kosareva.cloud
kosareva.cloud/ news/ keshirovanie-promptov-v-gpt-6-sol-i-luna-kak-uskorit-api
Гайды · · ·6 мин

Кэширование промптов в GPT-6 Sol и Luna: как ускорить API

Кэширование промптов в GPT-6 Sol и Luna: как ускорить API

Кратко

Кэширование промптов позволяет повторно использовать общую часть контекста между API-запросами. В семействе GPT-6, включая GPT-6 Sol и GPT-6 Luna, механизм получил более высокий процент попаданий в кэш по умолчанию, 30-минутное окно повторного использования подходящих префиксов и инструменты для диагностики промахов.

Для разработчика главный практический вывод прост: постоянные инструкции, описания инструментов и справочные материалы стоит размещать в начале контекста, а меняющиеся данные — ближе к концу.

Что изменилось в кэшировании GPT-6 Sol и GPT-6 Luna

Ниже — факты из сообщений OpenAI от 22 сентября 2026 года. Компания описывает улучшенное кэширование как механизм для моделей семейства GPT-6 и отдельно включает его в возможности GPT-6 Sol и GPT-6 Luna. В OpenAI API эти модели доступны под идентификаторами gpt-6-sol и gpt-6-luna.

Приложения с долгоживущими агентами выполняют серию связанных API-запросов. В каждом запросе могут повторяться системные инструкции, определения инструментов и контекст предыдущих шагов. Кэширование позволяет не обрабатывать эту общую часть заново.

В GPT-6 Sol и GPT-6 Luna, как и в других моделях семейства GPT-6, улучшенный механизм работает автоматически и предоставляет скидку до 90% на кэшированные входные токены. Подходящий общий префикс можно повторно использовать в течение 30 минут.

Появились и дополнительные средства управления:

  • панель с динамикой попаданий в кэш и соотношением кэшированных и некэшированных токенов;
  • диагностика промахов с указанием причины и количества затронутых токенов;
  • явные точки кэширования для выбора повторно используемой части промпта;
  • предварительный прогрев известного контекста;
  • изменение глубины рассуждений между ответами без потери кэша — при использовании описанного OpenAI механизма configuration_update.

В диагностике причиной промаха может быть, например, изменение набора инструментов. Отчёт показывает тип события, причину и оценку числа токенов, которые не удалось использовать повторно.

Для каких задач это полезно

Кэширование особенно важно там, где запросы имеют длинное и стабильное начало:

  • агент анализирует несколько файлов по одним правилам;
  • помощник отвечает по одной и той же базе документов;
  • модель последовательно обрабатывает записи в одинаковом формате;
  • API-клиент передаёт большой неизменный набор функций;
  • пользователь ведёт продолжительный диалог с накопленным контекстом.

Это подтверждённые сценарии повторного контекста. Следующий вывод уже аналитический: чем длиннее стабильная часть запроса и чем чаще она повторяется, тем заметнее может быть практический эффект. Однако конкретное ускорение и экономия зависят от структуры запросов. Их нужно измерять на собственной нагрузке, а не считать гарантированными.

Доступные модели можно проверить в каталоге Kosareva Cloud, а базовая схема первого запроса приведена в инструкции по подключению.

Как подготовить запросы к повторному использованию кэша

Оставьте постоянную часть в начале

В начало контекста поместите правила, формат ответа, справочные документы и определения инструментов. После них передавайте текущую задачу пользователя.

Не вставляйте в начало время запроса, случайный идентификатор или другие постоянно меняющиеся значения. Даже небольшое изменение префикса может помешать повторному использованию вычислений.

Не переставляйте инструменты без необходимости

OpenAI рекомендует сохранять определения инструментов, их схемы и порядок. Если в конкретном запросе нужен только один инструмент, можно ограничить список вызываемых функций через allowed_tools. Если инструменты не нужны, следует отключить их выбор, а не удалять определения из контекста.

Новые инструкции предлагается добавлять ближе к концу контекста. Так приложение может скорректировать поведение агента, сохранив стабильную начальную часть.

Измеряйте результат

После изменения промпта сравните долю кэшированных и некэшированных токенов. Если число попаданий неожиданно снизилось, проверьте модель, настройки, инструменты и входной контекст. Именно эти категории перечислены в официальном описании диагностики.

Три промпта для практической проверки

Следующие примеры не требуют специальной темы. Отправьте один и тот же постоянный блок несколько раз, меняя только последнюю строку с задачей.

1. Анализ договора

Ты анализируешь договор как редактор деловой документации.

Для каждого фрагмента:
1. Найди неоднозначные формулировки.
2. Укажи, какие данные или сроки не определены.
3. Предложи нейтральную редакцию без добавления новых условий.
4. Верни результат в таблице: фрагмент, проблема, предлагаемая редакция.

Не давай юридических гарантий и не придумывай отсутствующие сведения.

ТЕКУЩАЯ ЗАДАЧА:
Проверь следующий пункт договора:
[вставьте текст]

2. Разбор обращений клиентов

Ты классифицируешь обращения в службу поддержки.

Допустимые категории:
- ошибка доступа;
- вопрос об оплате;
- проблема интеграции;
- запрос функции;
- другое.

Верни JSON с полями category, summary, missing_information.
Не добавляй факты, которых нет в обращении. Если данных недостаточно,
перечисли их в missing_information.

ТЕКУЩЕЕ ОБРАЩЕНИЕ:
[вставьте текст]

3. Проверка программного кода

Ты проводишь ревью небольшого фрагмента кода.

Проверь:
- возможные ошибки выполнения;
- обработку входных данных;
- читаемость;
- лишние вычисления.

Сначала перечисли найденные проблемы по приоритету, затем предложи
исправленный вариант. Не меняй публичный интерфейс функции без необходимости.

КОД ДЛЯ ПРОВЕРКИ:
[вставьте код]

Во всех трёх примерах верхняя часть остаётся неизменной, а содержимое после последнего заголовка меняется. Это не гарантирует попадание в кэш: результат зависит от параметров и полной структуры API-запроса. Зато такой шаблон позволяет проверить механизм на понятной повторяемой нагрузке.

Частые вопросы

Работает ли кэширование в GPT-6 Sol и GPT-6 Luna?

Да. OpenAI относит улучшенное кэширование ко всему семейству GPT-6 и прямо упоминает его для GPT-6 Sol и GPT-6 Luna. Механизм повышает процент попаданий в кэш по умолчанию, а явные точки кэширования дают дополнительное управление.

Как долго можно повторно использовать общий префикс?

Для подходящих общих префиксов заявлено 30-минутное окно. Условия применимости следует проверять в актуальной документации API.

Что чаще всего нарушает повторное использование?

Источник называет изменения модели, инструментов, настроек и входных данных. В приведённом примере диагностики причиной выступает изменение инструментов.

Можно ли менять глубину рассуждений и сохранять кэш?

Для моделей GPT-6, включая GPT-6 Sol и GPT-6 Luna, это возможно через добавление configuration_update между ответами при неизменном параметре глубины рассуждений на уровне запроса.

Как понять, что оптимизация помогла?

Следует сравнить долю кэшированных токенов и задержку на серии одинаково построенных запросов. Отдельно проверьте, не изменилось ли качество ответов после перестройки контекста.

GPT-6 Sol и GPT-6 Luna доступны по API на kosareva.cloud с оплатой в рублях — можно протестировать приведённые промпты на собственных задачах.

Источники

OpenAI — Better prompt caching for GPT-6

OpenAI — Introducing GPT-6 Sol and Luna

/ Попробовать

Заведите аккаунт за минуту

Один ключ ко всем моделям из статьи. Пополнение от 50 ₽ картой или по счёту, списание по факту, без абонентской платы.

Дальше — ФИО и телефон в кабинете. Нажимая «Продолжить», вы соглашаетесь с офертой и политикой конфиденциальности.

или быстрый вход
Для бизнеса

Подключите бизнес ко всем нейросетям

Один договор с закрывающими документами, выделенный менеджер, ЭДО через Контур.Диадок или СБИС и специальные цены при больших объёмах. Оставьте контакты — пришлём проект договора и тестовый ключ.

  • Персональный менеджер с реакцией до 15 минут в рабочее время
  • Кастомный SLA с финансовыми санкциями за нарушение uptime
  • ЭДО через Контур.Диадок / СБИС
  • Постоплата по факту, акты раз в квартал
  • Защищённый канал + IP-белый список + аудит-логи
  • SSO через SAML / OIDC для корпоративных аккаунтов

Ответим за 4 рабочих часа проектом договора в PDF.
Не передаём данные третьим лицам и не звоним без вашей просьбы.

Отправляя заявку, вы соглашаетесь с политикой обработки персональных данных.