Gemini 3.5 Transcribe API — распознавание речи в рублях
Распознавание речи от Google: текст, json или субтитры srt и vtt из аудиофайла, больше 85 языков. Около 0,55 ₽ за минуту записи, оплата в рублях, без VPN — по OpenAI-совместимому API.
Что такое Gemini 3.5 Transcribe
Gemini 3.5 Transcribe — распознавание речи в текст и субтитры (больше 85 языков, таймкоды по словам, свой словарь терминов, запись до часа) от компании Google. Модель принимает на вход аудио и относится к категории «распознавание речи (stt)». Через kosareva.cloud модель доступна по единому OpenAI-совместимому API: тот же код, что и для OpenAI, — достаточно поменять base_url и ключ.
Напрямую у Google российская компания оплатить доступ не может: провайдер не принимает карты российских банков и не заключает договор с российским юрлицом. kosareva.cloud закрывает ровно этот разрыв — счёт выставляется в рублях армянским юрлицом, деньги уходят провайдеру, а вы получаете ключ и закрывающие документы. Запросы идут с российских IP, поэтому ни VPN, ни зарубежный хостинг для работы с Gemini 3.5 Transcribe не нужны.
Один ключ открывает не только Gemini 3.5 Transcribe: в каталоге больше сотни моделей — текстовых, картиночных, звуковых и видео. Это важнее, чем кажется: модели устаревают за месяцы, и переключение на следующую версию сводится к замене одной строки, а не к новому договору и новой интеграции.
Сильные и слабые стороны Gemini 3.5 Transcribe
Распознаёт речь больше чем на 85 языках и сам определяет язык, даже если собеседники переходят с одного на другой. Отдаёт не только текст, но и субтитры srt и vtt с таймкодами по словам — для роликов и протоколов совещаний ничего дорабатывать не нужно. Минута записи в среднем обходится около 0,55 ₽.
Это не живая расшифровка: файл отправляется целиком, и ответ приходит, когда распознана вся запись. Один запрос — до часа звука и до 25 МБ, с таймкодами — до 30 минут. Разделение говорящих у модели есть, но через наш API пока не отдаётся.
Кому подходит. Расшифровка звонков отдела продаж и поддержки, протоколы совещаний и интервью, субтитры к видео, голосовые сообщения в Telegram-ботах и CRM.
С чем сравнивать. Отдельная модель распознавания, а не чат: Gemini 3 Flash тоже принимает звук в сообщении, но ей нужен промпт, а ответ приходит обычным текстом чата. Здесь результат сразу в формате OpenAI — текстом, json или субтитрами. Других моделей распознавания речи в каталоге пока нет.
Место Gemini 3.5 Transcribe в каталоге
Пока это единственная модель категории «распознавание речи (stt)» в каталоге — сравнивать не с чем.
Цена Gemini 3.5 Transcribe в рублях
| Цена | около 0,55 ₽ за минуту |
| Из чего складывается | в среднем: звук 216 ₽ и текст 1 296 ₽ за 1 млн токенов |
Цена в таблице = цена в вашем счёте: в рублях, по договору, с закрывающими документами. Списание — только за фактическое использование.
Сколько стоит расшифровка на Gemini 3.5 Transcribe
Минута записи в среднем обходится около 0,55 ₽. Точная сумма считается по токенам: звук — 25 токенов в секунду, плюс текст расшифровки, поэтому плотная речь стоит чуть дороже, а запись с паузами — дешевле.
| Голосовое сообщение на 30 секундответ бота или запись в CRM | ≈ 0,28 ₽ |
| Звонок в поддержку на 5 минутрасшифровка для оценки качества | ≈ 2,8 ₽ |
| Совещание на часпротокол или субтитры к записи | ≈ 33,0 ₽ |
| Месяц колл-центра: 1 000 звонковпо 3 минуты каждый | ≈ 1 650 ₽ |
Оценка по средней цене минуты. Ошибочные запросы не тарифицируются.
Как подключить Gemini 3.5 Transcribe
Используйте стандартный OpenAI SDK, укажите base_url kosareva.cloud и модель gemini-3-5-transcribe. Менять в существующем коде нужно ровно две строки — адрес и ключ.
Python, OpenAI SDK
from openai import OpenAI
client = OpenAI(
api_key="ВАШ_КЛЮЧ_KOSAREVA",
base_url="https://api.kosareva.cloud/v1",
)
with open("meeting.mp3", "rb") as audio:
result = client.audio.transcriptions.create(
model="gemini-3-5-transcribe",
file=audio,
language="ru", # необязательно: язык модель определит сама
)
print(result.text)Python, без SDK — requests
import requests
with open("meeting.mp3", "rb") as audio:
response = requests.post(
"https://api.kosareva.cloud/v1/audio/transcriptions",
headers={"Authorization": "Bearer ВАШ_КЛЮЧ_KOSAREVA"},
files={"file": audio},
data={"model": "gemini-3-5-transcribe", "response_format": "srt"}, # субтитры с таймкодами
timeout=600,
)
response.raise_for_status()
print(response.text)cURL
curl https://api.kosareva.cloud/v1/audio/transcriptions \
-H "Authorization: Bearer ВАШ_КЛЮЧ_KOSAREVA" \
-F model="gemini-3-5-transcribe" \
-F file="@meeting.mp3" \
-F language="ru"Тот же ключ работает и с Anthropic SDK, и с любым клиентом, который умеет OpenAI-совместимый эндпоинт: LangChain, LlamaIndex, Cursor, Continue, n8n. Отдельного ключа под каждую модель заводить не нужно — один ключ открывает весь каталог.
Эндпоинты и параметры Gemini 3.5 Transcribe
Шлюз повторяет схему OpenAI, поэтому имена параметров и формат ответа те же, к которым вы привыкли. Базовый адрес один на все модели каталога.
| base_url | https://api.kosareva.cloud/v1 |
| Эндпоинт | /audio/transcriptions |
| Имя модели | gemini-3-5-transcribe |
| Авторизация | Authorization: Bearer <ключ> |
| Основные параметры | file — запись до 25 МБ (mp3, mp4, m4a, wav, ogg, webm, flac, aac), language — код языка, например ru, prompt — термины и имена через запятую |
| Ответ | response_format: json (по умолчанию), text, srt, vtt, verbose_json — с таймкодами фраз и слов |
| Длина записи | до 60 минут, с таймкодами (srt, vtt, verbose_json) — до 30 минут |
| Список моделей | GET /v1/models |
Подробно о форматах ответа, языках и ограничениях — в документации по распознаванию речи.
Характеристики
| Провайдер | |
| Тип | Распознавание речи (STT) |
| Ввод | Аудио |
| Вывод | Текст |
| API | OpenAI-совместимый |
Для чего подходит Gemini 3.5 Transcribe
- Расшифровка звонков отдела продаж и поддержки
- Протоколы совещаний, интервью и лекций
- Субтитры srt и vtt к видео
- Голосовые сообщения в Telegram-ботах и CRM
Что учесть при работе с Gemini 3.5 Transcribe
Подключается тем же кодом, что Whisper у OpenAI: метод audio.transcriptions.create, в model — gemini-3-5-transcribe. Если инструмент по умолчанию шлёт whisper-1, поменяйте имя модели. Термины и имена передайте в prompt списком через запятую — модель возьмёт их как словарь. Связный текст в prompt не учитывается, а вместе с таймкодами (srt, vtt, verbose_json) словарь не работает вовсе.
Первое — запрос принимает файл до 25 МБ и до часа звука, с таймкодами (srt, vtt, verbose_json) — до 30 минут. Длинные записи сжимайте в mp3 или ogg: час речи в mp3 на 48 кбит/с занимает около 21 МБ. Что не помещается, режьте на части по паузам — так и повторить неудачный кусок дешевле.
Второе — цена считается по токенам: звук — 25 токенов в секунду, плюс текст расшифровки. Поэтому минута плотной речи стоит чуть дороже минуты с паузами, а в среднем выходит около 0,55 ₽ за минуту.
Третье — баланс общий на все модели каталога. Не нужно заранее решать, сколько денег «положить на Gemini 3.5 Transcribe»: те же средства уйдут на любую другую модель, если завтра вы переключитесь. Расход по каждой модели виден в личном кабинете отдельной строкой, вместе с числом запросов и токенов.
Gemini 3.5 Transcribe с оплатой в рублях и без VPN
Gemini 3.5 Transcribe от Google — распознавание речи в текст и субтитры (больше 85 языков, таймкоды по словам, свой словарь терминов, запись до часа). Доступ через kosareva.cloud без VPN и зарубежных карт, оплата в рублях, OpenAI-совместимый API.
- Оплата в рублях по карте или счёту — для юрлиц договор, акт и инвойс.
- Без VPN и зарубежных карт: запросы идут с российских IP.
- Единый OpenAI-совместимый API к Gemini 3.5 Transcribe и ещё 100+ моделям по одному ключу.
- Оплата только за фактическое использование, без абонентской платы.
Другие модели Google
Частые вопросы о Gemini 3.5 Transcribe
Сколько стоит Gemini 3.5 Transcribe в рублях?
В среднем около 0,55 ₽ за минуту записи: звук 216 ₽ и текст 1 296 ₽ за 1 млн токенов. Звук — 25 токенов в секунду, текст считается по длине расшифровки. Это цена в вашем счёте: по договору, без скрытых наценок и валютных потерь.
Как подключить Gemini 3.5 Transcribe через API из России?
Зарегистрируйтесь на kosareva.cloud, получите ключ и отправьте аудиофайл на POST https://api.kosareva.cloud/v1/audio/transcriptions с моделью «gemini-3-5-transcribe» — в ответ придёт текст или субтитры. Подходит стандартный OpenAI SDK, метод audio.transcriptions.create, как для Whisper. Оплата в рублях, VPN не нужен.
Кому подходит Gemini 3.5 Transcribe и в чём его слабые места?
Расшифровка звонков отдела продаж и поддержки, протоколы совещаний и интервью, субтитры к видео, голосовые сообщения в Telegram-ботах и CRM. Это не живая расшифровка: файл отправляется целиком, и ответ приходит, когда распознана вся запись. Один запрос — до часа звука и до 25 МБ, с таймкодами — до 30 минут. Разделение говорящих у модели есть, но через наш API пока не отдаётся.
С какими моделями сравнивать Gemini 3.5 Transcribe?
Отдельная модель распознавания, а не чат: Gemini 3 Flash тоже принимает звук в сообщении, но ей нужен промпт, а ответ приходит обычным текстом чата. Здесь результат сразу в формате OpenAI — текстом, json или субтитрами. Других моделей распознавания речи в каталоге пока нет.
Что учесть при работе с Gemini 3.5 Transcribe?
Подключается тем же кодом, что Whisper у OpenAI: метод audio.transcriptions.create, в model — gemini-3-5-transcribe. Если инструмент по умолчанию шлёт whisper-1, поменяйте имя модели. Термины и имена передайте в prompt списком через запятую — модель возьмёт их как словарь. Связный текст в prompt не учитывается, а вместе с таймкодами (srt, vtt, verbose_json) словарь не работает вовсе.
Нужен ли VPN или зарубежная карта для Gemini 3.5 Transcribe?
Нет. Запросы идут с российских IP через kosareva.cloud, оплата — в рублях с закрывающими документами для юрлиц.
Можно ли попробовать Gemini 3.5 Transcribe на небольшой сумме?
Да. Минимальное пополнение — 50 ₽, абонентской платы нет, списание — по факту за распознанные записи. Неизрасходованный баланс не сгорает, поэтому расшифровать пробную минуту стоит меньше рубля.
Какие документы получит юрлицо при работе с Gemini 3.5 Transcribe?
Договор, счёт на оплату, акт и инвойс. Оплата — банковским переводом в рублях; карты, p2p и криптовалюта не используются. Расходы на API проходят по бухгалтерии как обычная услуга.
Подключить Gemini 3.5 Transcribe за пару минут
Получите API-ключ и обращайтесь к Gemini 3.5 Transcribe по OpenAI-совместимому эндпоинту с оплатой в рублях.