kosareva.cloud

Gemini 3.5 Transcribe API — распознавание речи в рублях

Google · Распознавание речи (STT) ·

Распознавание речи от Google: текст, json или субтитры srt и vtt из аудиофайла, больше 85 языков. Около 0,55 ₽ за минуту записи, оплата в рублях, без VPN — по OpenAI-совместимому API.

Модальности
→Вход: Аудио. Выход: Текст.
Цена
≈ 0,55 ₽ за минуту
Провайдер
Google

Что такое Gemini 3.5 Transcribe

Gemini 3.5 Transcribe — распознавание речи в текст и субтитры (больше 85 языков, таймкоды по словам, свой словарь терминов, запись до часа) от компании Google. Модель принимает на вход аудио и относится к категории «распознавание речи (stt)». Через kosareva.cloud модель доступна по единому OpenAI-совместимому API: тот же код, что и для OpenAI, — достаточно поменять base_url и ключ.

Напрямую у Google российская компания оплатить доступ не может: провайдер не принимает карты российских банков и не заключает договор с российским юрлицом. kosareva.cloud закрывает ровно этот разрыв — счёт выставляется в рублях армянским юрлицом, деньги уходят провайдеру, а вы получаете ключ и закрывающие документы. Запросы идут с российских IP, поэтому ни VPN, ни зарубежный хостинг для работы с Gemini 3.5 Transcribe не нужны.

Один ключ открывает не только Gemini 3.5 Transcribe: в каталоге больше сотни моделей — текстовых, картиночных, звуковых и видео. Это важнее, чем кажется: модели устаревают за месяцы, и переключение на следующую версию сводится к замене одной строки, а не к новому договору и новой интеграции.

Сильные и слабые стороны Gemini 3.5 Transcribe

В чём хороша

Распознаёт речь больше чем на 85 языках и сам определяет язык, даже если собеседники переходят с одного на другой. Отдаёт не только текст, но и субтитры srt и vtt с таймкодами по словам — для роликов и протоколов совещаний ничего дорабатывать не нужно. Минута записи в среднем обходится около 0,55 ₽.

Где проседает

Это не живая расшифровка: файл отправляется целиком, и ответ приходит, когда распознана вся запись. Один запрос — до часа звука и до 25 МБ, с таймкодами — до 30 минут. Разделение говорящих у модели есть, но через наш API пока не отдаётся.

Кому подходит. Расшифровка звонков отдела продаж и поддержки, протоколы совещаний и интервью, субтитры к видео, голосовые сообщения в Telegram-ботах и CRM.

С чем сравнивать. Отдельная модель распознавания, а не чат: Gemini 3 Flash тоже принимает звук в сообщении, но ей нужен промпт, а ответ приходит обычным текстом чата. Здесь результат сразу в формате OpenAI — текстом, json или субтитрами. Других моделей распознавания речи в каталоге пока нет.

Место Gemini 3.5 Transcribe в каталоге

Пока это единственная модель категории «распознавание речи (stt)» в каталоге — сравнивать не с чем.

Цена Gemini 3.5 Transcribe в рублях

Ценаоколо 0,55 ₽ за минуту
Из чего складываетсяв среднем: звук 216 ₽ и текст 1 296 ₽ за 1 млн токенов

Цена в таблице = цена в вашем счёте: в рублях, по договору, с закрывающими документами. Списание — только за фактическое использование.

Сколько стоит расшифровка на Gemini 3.5 Transcribe

Минута записи в среднем обходится около 0,55 ₽. Точная сумма считается по токенам: звук — 25 токенов в секунду, плюс текст расшифровки, поэтому плотная речь стоит чуть дороже, а запись с паузами — дешевле.

Голосовое сообщение на 30 секундответ бота или запись в CRM≈ 0,28 ₽
Звонок в поддержку на 5 минутрасшифровка для оценки качества≈ 2,8 ₽
Совещание на часпротокол или субтитры к записи≈ 33,0 ₽
Месяц колл-центра: 1 000 звонковпо 3 минуты каждый≈ 1 650 ₽

Оценка по средней цене минуты. Ошибочные запросы не тарифицируются.

Как подключить Gemini 3.5 Transcribe

Используйте стандартный OpenAI SDK, укажите base_url kosareva.cloud и модель gemini-3-5-transcribe. Менять в существующем коде нужно ровно две строки — адрес и ключ.

Python, OpenAI SDK

from openai import OpenAI

client = OpenAI(
    api_key="ВАШ_КЛЮЧ_KOSAREVA",
    base_url="https://api.kosareva.cloud/v1",
)

with open("meeting.mp3", "rb") as audio:
    result = client.audio.transcriptions.create(
        model="gemini-3-5-transcribe",
        file=audio,
        language="ru",  # необязательно: язык модель определит сама
    )
print(result.text)

Python, без SDK — requests

import requests

with open("meeting.mp3", "rb") as audio:
    response = requests.post(
        "https://api.kosareva.cloud/v1/audio/transcriptions",
        headers={"Authorization": "Bearer ВАШ_КЛЮЧ_KOSAREVA"},
        files={"file": audio},
        data={"model": "gemini-3-5-transcribe", "response_format": "srt"},  # субтитры с таймкодами
        timeout=600,
    )
response.raise_for_status()
print(response.text)

cURL

curl https://api.kosareva.cloud/v1/audio/transcriptions \
  -H "Authorization: Bearer ВАШ_КЛЮЧ_KOSAREVA" \
  -F model="gemini-3-5-transcribe" \
  -F file="@meeting.mp3" \
  -F language="ru"

Тот же ключ работает и с Anthropic SDK, и с любым клиентом, который умеет OpenAI-совместимый эндпоинт: LangChain, LlamaIndex, Cursor, Continue, n8n. Отдельного ключа под каждую модель заводить не нужно — один ключ открывает весь каталог.

Эндпоинты и параметры Gemini 3.5 Transcribe

Шлюз повторяет схему OpenAI, поэтому имена параметров и формат ответа те же, к которым вы привыкли. Базовый адрес один на все модели каталога.

base_urlhttps://api.kosareva.cloud/v1
Эндпоинт/audio/transcriptions
Имя моделиgemini-3-5-transcribe
АвторизацияAuthorization: Bearer <ключ>
Основные параметрыfile — запись до 25 МБ (mp3, mp4, m4a, wav, ogg, webm, flac, aac), language — код языка, например ru, prompt — термины и имена через запятую
Ответresponse_format: json (по умолчанию), text, srt, vtt, verbose_json — с таймкодами фраз и слов
Длина записидо 60 минут, с таймкодами (srt, vtt, verbose_json) — до 30 минут
Список моделейGET /v1/models

Подробно о форматах ответа, языках и ограничениях — в документации по распознаванию речи.

Характеристики

ПровайдерGoogle
ТипРаспознавание речи (STT)
ВводАудио
ВыводТекст
APIOpenAI-совместимый

Для чего подходит Gemini 3.5 Transcribe

  • Расшифровка звонков отдела продаж и поддержки
  • Протоколы совещаний, интервью и лекций
  • Субтитры srt и vtt к видео
  • Голосовые сообщения в Telegram-ботах и CRM

Что учесть при работе с Gemini 3.5 Transcribe

Подключается тем же кодом, что Whisper у OpenAI: метод audio.transcriptions.create, в model — gemini-3-5-transcribe. Если инструмент по умолчанию шлёт whisper-1, поменяйте имя модели. Термины и имена передайте в prompt списком через запятую — модель возьмёт их как словарь. Связный текст в prompt не учитывается, а вместе с таймкодами (srt, vtt, verbose_json) словарь не работает вовсе.

Первое — запрос принимает файл до 25 МБ и до часа звука, с таймкодами (srt, vtt, verbose_json) — до 30 минут. Длинные записи сжимайте в mp3 или ogg: час речи в mp3 на 48 кбит/с занимает около 21 МБ. Что не помещается, режьте на части по паузам — так и повторить неудачный кусок дешевле.

Второе — цена считается по токенам: звук — 25 токенов в секунду, плюс текст расшифровки. Поэтому минута плотной речи стоит чуть дороже минуты с паузами, а в среднем выходит около 0,55 ₽ за минуту.

Третье — баланс общий на все модели каталога. Не нужно заранее решать, сколько денег «положить на Gemini 3.5 Transcribe»: те же средства уйдут на любую другую модель, если завтра вы переключитесь. Расход по каждой модели виден в личном кабинете отдельной строкой, вместе с числом запросов и токенов.

Gemini 3.5 Transcribe с оплатой в рублях и без VPN

Gemini 3.5 Transcribe от Google — распознавание речи в текст и субтитры (больше 85 языков, таймкоды по словам, свой словарь терминов, запись до часа). Доступ через kosareva.cloud без VPN и зарубежных карт, оплата в рублях, OpenAI-совместимый API.

  • Оплата в рублях по карте или счёту — для юрлиц договор, акт и инвойс.
  • Без VPN и зарубежных карт: запросы идут с российских IP.
  • Единый OpenAI-совместимый API к Gemini 3.5 Transcribe и ещё 100+ моделям по одному ключу.
  • Оплата только за фактическое использование, без абонентской платы.

Другие модели Google

Частые вопросы о Gemini 3.5 Transcribe

Сколько стоит Gemini 3.5 Transcribe в рублях?

В среднем около 0,55 ₽ за минуту записи: звук 216 ₽ и текст 1 296 ₽ за 1 млн токенов. Звук — 25 токенов в секунду, текст считается по длине расшифровки. Это цена в вашем счёте: по договору, без скрытых наценок и валютных потерь.

Как подключить Gemini 3.5 Transcribe через API из России?

Зарегистрируйтесь на kosareva.cloud, получите ключ и отправьте аудиофайл на POST https://api.kosareva.cloud/v1/audio/transcriptions с моделью «gemini-3-5-transcribe» — в ответ придёт текст или субтитры. Подходит стандартный OpenAI SDK, метод audio.transcriptions.create, как для Whisper. Оплата в рублях, VPN не нужен.

Кому подходит Gemini 3.5 Transcribe и в чём его слабые места?

Расшифровка звонков отдела продаж и поддержки, протоколы совещаний и интервью, субтитры к видео, голосовые сообщения в Telegram-ботах и CRM. Это не живая расшифровка: файл отправляется целиком, и ответ приходит, когда распознана вся запись. Один запрос — до часа звука и до 25 МБ, с таймкодами — до 30 минут. Разделение говорящих у модели есть, но через наш API пока не отдаётся.

С какими моделями сравнивать Gemini 3.5 Transcribe?

Отдельная модель распознавания, а не чат: Gemini 3 Flash тоже принимает звук в сообщении, но ей нужен промпт, а ответ приходит обычным текстом чата. Здесь результат сразу в формате OpenAI — текстом, json или субтитрами. Других моделей распознавания речи в каталоге пока нет.

Что учесть при работе с Gemini 3.5 Transcribe?

Подключается тем же кодом, что Whisper у OpenAI: метод audio.transcriptions.create, в model — gemini-3-5-transcribe. Если инструмент по умолчанию шлёт whisper-1, поменяйте имя модели. Термины и имена передайте в prompt списком через запятую — модель возьмёт их как словарь. Связный текст в prompt не учитывается, а вместе с таймкодами (srt, vtt, verbose_json) словарь не работает вовсе.

Нужен ли VPN или зарубежная карта для Gemini 3.5 Transcribe?

Нет. Запросы идут с российских IP через kosareva.cloud, оплата — в рублях с закрывающими документами для юрлиц.

Можно ли попробовать Gemini 3.5 Transcribe на небольшой сумме?

Да. Минимальное пополнение — 50 ₽, абонентской платы нет, списание — по факту за распознанные записи. Неизрасходованный баланс не сгорает, поэтому расшифровать пробную минуту стоит меньше рубля.

Какие документы получит юрлицо при работе с Gemini 3.5 Transcribe?

Договор, счёт на оплату, акт и инвойс. Оплата — банковским переводом в рублях; карты, p2p и криптовалюта не используются. Расходы на API проходят по бухгалтерии как обычная услуга.

Подключить Gemini 3.5 Transcribe за пару минут

Получите API-ключ и обращайтесь к Gemini 3.5 Transcribe по OpenAI-совместимому эндпоинту с оплатой в рублях.