kosareva.cloud

Llama 3.3 70B API — цена в рублях

Meta · Чат и генерация текста

Открытая модель Meta на 70 млрд параметров: контекст 128K, вход и выход стоят одинаково. Подключается через API kosareva.cloud с оплатой в рублях — без VPN и зарубежных карт.

Модальности
Вход: Текст. Выход: Текст.
Вход / выход за 1M
76,68 ₽ / 76,68 ₽
Контекст
128K токенов
Провайдер
Meta

Что такое Llama 3.3 70B

Llama 3.3 70B — открытая модель meta на 70 млрд параметров: контекст 128k, вход и выход стоят одинаково от компании Meta. Модель поддерживает контекстное окно 128K токенов, принимает на вход текст и относится к категории «чат и генерация текста». Через kosareva.cloud модель доступна по единому OpenAI-совместимому API: тот же код, что и для OpenAI, — достаточно поменять base_url и ключ.

Напрямую у Meta российская компания оплатить доступ не может: провайдер не принимает карты российских банков и не заключает договор с российским юрлицом. kosareva.cloud закрывает ровно этот разрыв — счёт выставляется в рублях армянским юрлицом, деньги уходят провайдеру, а вы получаете ключ и закрывающие документы. Запросы идут с российских IP, поэтому ни VPN, ни зарубежный хостинг для работы с Llama 3.3 70B не нужны.

Один ключ открывает не только Llama 3.3 70B: в каталоге больше сотни моделей — текстовых, картиночных, звуковых и видео. Это важнее, чем кажется: модели устаревают за месяцы, и переключение на следующую версию сводится к замене одной строки, а не к новому договору и новой интеграции.

Сильные и слабые стороны Llama 3.3 70B

В чём хороша

Редкий случай, когда выход стоит столько же, сколько вход: 76,68 ₽ за миллион в обе стороны. Плотная модель на 70 млрд параметров с открытыми весами и контекстом 128 000 — поведение у неё изучено вдоль и поперёк, под неё написаны тысячи готовых промптов, и переносить на неё уже работающие сценарии обычно не больно.

Где проседает

Это поколение 2024 года: рассуждает короче и площе современных моделей того же ценового уровня, картинки не принимает. Русского в списке официально поддерживаемых языков нет: он работает, но заметно хуже английского, формулировки приходится править. Ответ ограничен 8 192 токенами — длинный документ одним куском она не напишет.

Кому подходит. Перенос готовых сценариев с локальной Llama в облако без переписывания промптов, генерация синтетических данных, суммаризация и разбор англоязычных документов, длинные ответы, где важна цена выхода.

С чем сравнивать. Против Mistral Large 3 (54 / 162 ₽): вход дороже в полтора раза, зато выход вдвое дешевле, а контекст меньше — 128K против 262K. Против Gemini 3 Flash (54 / 324 ₽) — выход дешевле вчетверо, но контекст 128K против миллиона.

Место Llama 3.3 70B в каталоге

Из 89 моделей категории «чат и генерация текста» в каталоге Llama 3.3 70B занимает 34-е место по цене — считая от самой дешёвой. Ближайший вариант дешевле — Kimi K2.7 Code HighSpeed за 71,28 ₽ за 1 млн токенов, это на 8% меньше. Следующая ступень вверх — GPT-5.4 Mini за 81 ₽ за 1 млн токенов, дороже на 6%. По размеру контекста (128K токенов) модель 88-я среди 117 моделей каталога с заявленным окном.

Цена Llama 3.3 70B в рублях

Ввод (input)76,68 ₽ за 1 млн токенов
Вывод (output)76,68 ₽ за 1 млн токенов

Цена в таблице = цена в вашем счёте: в рублях, по договору, с закрывающими документами. Списание — только за фактическое использование.

Сколько стоит типовая задача на Llama 3.3 70B

Цена за миллион токенов сама по себе мало что говорит, поэтому вот четыре обычные задачи, посчитанные по тарифу Llama 3.3 70B: 76,68 ₽ за миллион входных токенов и 76,68 ₽ за миллион выходных. Токен — примерно две трети слова в русском тексте, так что страница A4 — это около 700 токенов.

Ответ в чате или ботекороткий вопрос и абзац ответа0,12 ₽
Разбор документа на 30 страницвесь текст в запросе, на выходе — выжимка3,2 ₽
Статья или коммерческое предложениекраткое задание, длинный текст в ответ0,46 ₽
Месяц поддержки: 1 000 обращенийпо 1 500 токенов запроса и 400 ответа146 ₽

Расчёт по действующему прайсу kosareva.cloud. Кэширование входа, если модель его поддерживает, снижает эти суммы ещё сильнее.

Калькулятор стоимости Llama 3.3 70B

Подвиньте ползунки под свой объём — расход в рублях за месяц посчитается сразу, без регистрации и без обращения к менеджеру.

Запросов в месяц
0100 000
Токенов на вход
060 000
Токенов на выход
032 000
Вход
Выход
Один запрос
Токенов в месяц
Расход в месяц
Получить API-ключ

Расчёт по действующему прайсу: 76,68 ₽ за миллион входных токенов и 76,68 ₽ за миллион выходных. Цены с НДС, списание — по факту.

Как подключить Llama 3.3 70B

Используйте стандартный OpenAI SDK, укажите base_url kosareva.cloud и модель llama-3-3-70b. Менять в существующем коде нужно ровно две строки — адрес и ключ.

Python, OpenAI SDK

from openai import OpenAI

client = OpenAI(
    api_key="ВАШ_КЛЮЧ_KOSAREVA",
    base_url="https://api.kosareva.cloud/v1",
)

response = client.chat.completions.create(
    model="llama-3-3-70b",
    messages=[{"role": "user", "content": "Привет!"}],
)
print(response.choices[0].message.content)

Python, без SDK — requests

import requests

response = requests.post(
    "https://api.kosareva.cloud/v1/chat/completions",
    headers={"Authorization": "Bearer ВАШ_КЛЮЧ_KOSAREVA"},
    json={
        "model": "llama-3-3-70b",
        "messages": [{"role": "user", "content": "Привет!"}],
    },
    timeout=600,
)
print(response.json()["choices"][0]["message"]["content"])

cURL

curl https://api.kosareva.cloud/v1/chat/completions \
  -H "Authorization: Bearer ВАШ_КЛЮЧ_KOSAREVA" \
  -H "Content-Type: application/json" \
  -d '{"model":"llama-3-3-70b","messages":[{"role":"user","content":"Привет!"}]}'

Тот же ключ работает и с Anthropic SDK, и с любым клиентом, который умеет OpenAI-совместимый эндпоинт: LangChain, LlamaIndex, Cursor, Continue, n8n. Отдельного ключа под каждую модель заводить не нужно — один ключ открывает весь каталог.

Эндпоинты и параметры Llama 3.3 70B

Шлюз повторяет схему OpenAI, поэтому имена параметров и формат ответа те же, к которым вы привыкли. Базовый адрес один на все модели каталога.

base_urlhttps://api.kosareva.cloud/v1
Эндпоинт/chat/completions
Имя моделиllama-3-3-70b
АвторизацияAuthorization: Bearer <ключ>
Потоковый ответstream: true — ответ приходит по мере генерации
Основные параметрыtemperature, max_tokens, top_p, stop, tools
Список моделейGET /v1/models

Долгие ответы лучше запрашивать со stream: true: при большом max_tokens обычный запрос молчит до самого конца генерации и может упереться в таймаут вашего HTTP-клиента. В потоковом режиме первые токены приходят через секунды, и обрыв по таймауту исчезает сам собой.

Характеристики

ПровайдерMeta
ТипЧат и генерация текста
Контекст128K токенов
ВводТекст
ВыводТекст
APIOpenAI-совместимый

Для чего подходит Llama 3.3 70B

  • Чат-боты, ассистенты, вопросы-ответы, поддержка

Что учесть при работе с Llama 3.3 70B

Симметричная цена — это главное, ради чего её берут: у большинства соседей выход дороже входа в три-четыре раза, а здесь платите одинаково. Отсюда и сценарий: задачи с длинным ответом — расшифровки, черновики, синтетика для обучения своих моделей. Полный ответ на 8 192 токена стоит 63 копейки, так что генерировать можно щедро. И держите в голове тот же потолок в 8 192 токена: длинный текст придётся резать на части и собирать у себя, модель сама продолжения не допишет.

Первое — контекст расходуется быстрее, чем кажется. В диалоге на вход уходит вся переписка целиком, а не только последняя реплика, поэтому длинный чат дорожает с каждым ходом. Если история не нужна для ответа, обрезайте её: экономия на входных токенах обычно заметнее, чем выбор более дешёвой модели.

Второе — заявленное окно 128K токенов делится между запросом и ответом: чем больше вы отправили, тем меньше места остаётся модели на генерацию. Ограничение max_tokens стоит ставить осознанно, а не «с запасом».

Третье — баланс общий на все модели каталога. Не нужно заранее решать, сколько денег «положить на Llama 3.3 70B»: те же средства уйдут на любую другую модель, если завтра вы переключитесь. Расход по каждой модели виден в личном кабинете отдельной строкой, вместе с числом запросов и токенов.

Llama 3.3 70B с оплатой в рублях и без VPN

Llama 3.3 70B от Meta — открытая модель Meta на 70 млрд параметров: контекст 128K, вход и выход стоят одинаково. Доступ через kosareva.cloud без VPN и зарубежных карт, оплата в рублях, OpenAI-совместимый API.

  • Оплата в рублях по карте или счёту — для юрлиц договор, акт и инвойс.
  • Без VPN и зарубежных карт: запросы идут с российских IP.
  • Единый OpenAI-совместимый API к Llama 3.3 70B и ещё 100+ моделям по одному ключу.
  • Оплата только за фактическое использование, без абонентской платы.

Другие модели Meta

Частые вопросы о Llama 3.3 70B

Сколько стоит Llama 3.3 70B в рублях?

Ввод — 76,68 ₽ за 1 млн токенов, вывод — 76,68 ₽ за 1 млн токенов. Это цена в вашем счёте: по договору, без скрытых наценок и валютных потерь.

Как подключить Llama 3.3 70B через API из России?

Зарегистрируйтесь на kosareva.cloud, получите ключ, укажите base_url https://api.kosareva.cloud/v1 и модель «llama-3-3-70b» в стандартном OpenAI SDK. Оплата в рублях, VPN не нужен.

Какой размер контекста у Llama 3.3 70B?

Контекстное окно — 128K токенов. Этого достаточно для работы с длинными документами, кодовыми базами и большими диалогами.

Кому подходит Llama 3.3 70B и в чём его слабые места?

Перенос готовых сценариев с локальной Llama в облако без переписывания промптов, генерация синтетических данных, суммаризация и разбор англоязычных документов, длинные ответы, где важна цена выхода. Это поколение 2024 года: рассуждает короче и площе современных моделей того же ценового уровня, картинки не принимает. Русского в списке официально поддерживаемых языков нет: он работает, но заметно хуже английского, формулировки приходится править. Ответ ограничен 8 192 токенами — длинный документ одним куском она не напишет.

С какими моделями сравнивать Llama 3.3 70B?

Против Mistral Large 3 (54 / 162 ₽): вход дороже в полтора раза, зато выход вдвое дешевле, а контекст меньше — 128K против 262K. Против Gemini 3 Flash (54 / 324 ₽) — выход дешевле вчетверо, но контекст 128K против миллиона.

Что учесть при работе с Llama 3.3 70B?

Симметричная цена — это главное, ради чего её берут: у большинства соседей выход дороже входа в три-четыре раза, а здесь платите одинаково. Отсюда и сценарий: задачи с длинным ответом — расшифровки, черновики, синтетика для обучения своих моделей. Полный ответ на 8 192 токена стоит 63 копейки, так что генерировать можно щедро. И держите в голове тот же потолок в 8 192 токена: длинный текст придётся резать на части и собирать у себя, модель сама продолжения не допишет.

Нужен ли VPN или зарубежная карта для Llama 3.3 70B?

Нет. Запросы идут с российских IP через kosareva.cloud, оплата — в рублях с закрывающими документами для юрлиц.

Можно ли попробовать Llama 3.3 70B на небольшой сумме?

Да. Минимальное пополнение — 50 ₽, списание идёт по факту за использованные токены, абонентской платы нет. Неизрасходованный баланс не сгорает, поэтому протестировать модель на паре сотен запросов стоит копейки.

Какие документы получит юрлицо при работе с Llama 3.3 70B?

Договор, счёт на оплату, акт и инвойс. Оплата — банковским переводом в рублях; карты, p2p и криптовалюта не используются. Расходы на API проходят по бухгалтерии как обычная услуга.

Подключить Llama 3.3 70B за пару минут

Получите API-ключ и обращайтесь к Llama 3.3 70B по OpenAI-совместимому эндпоинту с оплатой в рублях.