Новинка: Grom Zvuk — наша музыкальная модельПослушать и попробовать

Gemini 3.8 Flash: что изменилось и как вызвать по API

Gemini 3.8 Flash: что изменилось и как вызвать по API

Google выпустил Gemini 3.8 Flash 2 сентября 2026 года — третий релиз линейки Flash за шесть недель. Модель уже в каталоге GPTunneL под id gemini-3.8-flash. Коротко: API не поменялся ни на один параметр, лимиты те же, прирост — в длинных агентных задачах и профессиональных доменах. Если у тебя код под 3.7 Flash, миграция — замена строки с именем модели.

Что вышло

Из карточки модели:

ПараметрЗначение
Входтекст, изображение, видео, аудио, PDF
Выходтекст
Лимит входа1 048 576 токенов
Лимит выхода65 536 токенов
Мышлениеlow, medium, high; minimal возвращает ошибку
Естьfunction calling, structured outputs, code execution, search grounding, context caching, Batch
Previewcomputer use
Нетгенерация изображений и аудио, Live API

Таблица совпадает с 3.7 Flash строка в строку. Google прямо пишет, что скорость и цена в родном API остались прежними, а изменилось поведение: модель делает больше шагов рассуждения и чаще повторно вызывает инструменты, прежде чем отдать ответ.

Минимальный запрос

Шлюз GPTunneL совместим с OpenAI, ключ идёт в Authorization без префикса Bearer:

bash
curl https://gptunnel.ru/v1/chat/completions \
  -H "Authorization: <ВАШ_API_КЛЮЧ>" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.8-flash",
    "messages": [{"role": "user", "content": "Ответь одним словом: столица Франции?"}]
  }'

Ответ, который я получил перед публикацией:

JSON
{
  "model": "gemini-3.8-flash",
  "choices": [{"message": {"role": "assistant", "content": "Париж"}, "finish_reason": "stop"}],
  "usage": {
    "prompt_tokens": 11,
    "completion_tokens": 108,
    "total_tokens": 119,
    "prompt_cost": 0.0033,
    "completion_cost": 0.162,
    "total_cost": 0.1653,
    "prompt_tokens_details": {"cached_tokens": 0}
  }
}

Одно слово — 108 выходных токенов. Мышление тарифицируется как выход, и у 3.8 Flash его по замыслу Google стало больше. Считай расход по total_cost из usage, а не по длине видимого ответа.

Глубина рассуждений через шлюз задаётся параметром reasoning_effort со значениями low, medium, high; гугловский thinking_level шлюз молча игнорирует. Замеры по уровням на 3.7 Flash — в прошлой статье, механика у 3.8 та же.

Что выросло по бенчмаркам

Google сравнивает 3.8 Flash не с прошлой версией, а с флагманами конкурентов:

Бенчмарк3.7 Flash3.8 FlashClaude Opus 5GPT-5.6 Sol
Vals Finance Agent v259,0%61,4%58,6%53,8%
Harvey Legal Agent8,8%10,0%6,7%2,5%
HLE-Verified53,6%54,9%54,4%54,5%

На DeepSWE v1.1 — длинных задачах разработки от постановки до готового патча — Google показывает результат выше 70% при стоимости заметно ниже, чем у крупных моделей; точной цифры в анонсе нет. Сторонние обзоры приводят Terminal-Bench 2.1: 90,8% против 81,6% у 3.7 Flash.

Читать это надо трезво. Прирост над 3.7 Flash — 1–2 процентных пункта на профессиональных агентных тестах, а не скачок вроде DeepSWE 49% → 65% месяц назад. Обгон Opus 5 и Sol — на узких доменных бенчмарках финансов и права. На общих агентных задачах вроде OSWorld флагманы, по сторонним сводкам, остаются впереди. Если у тебя многошаговый агент с инструментами в предметной области — стоит перепрогнать. Если классификатор или саммари — разницы не увидишь.

3.8 Flash Cyber

Вместе с основной моделью Google выпустил вариант для кибербезопасности: поиск уязвимостей в двадцати языках с успехом выше 70% и автопатчинг на CWE-Bench 47,2% pass@1. В открытый API он не попал: доступ только по программе Fairwind для госорганов, операторов инфраструктуры и мейнтейнеров. Через GPTunneL его нет и не будет, пока Google не откроет модель публично.

Что проверить перед переключением

  • max_tokens. Потолок ест мышление раньше ответа: на 3.7 Flash при max_tokens: 16 приходил пустой контент с finish_reason: "length". У 3.8 рассуждений больше — ставь запас ещё щедрее.
  • Таймауты. Дополнительные шаги и повторные вызовы инструментов — это время. Клиентский таймаут в 30 секунд будет рвать нормальные ответы на high; 180 секунд и ретраи с экспоненциальной паузой.
  • Счёт. Больше рассуждений при той же цене за токен — больше токенов за задачу. Сравни total_cost на своих запросах до и после, а не тарифы в каталоге.
  • Structured outputs и стриминг работают как раньше: response_format со схемой и stream: true. Keepalive-комментарии : HELLO и : PROCESSING перед первым чанком шлюз по-прежнему шлёт — парсер должен пропускать строки без data: .

Сколько стоит

В GPTunneL Gemini 3.8 Flash тарифицируется за токены: 300 ₽ за 1M на входе и 1500 ₽ за 1M на выходе, но сейчас действует скидка 50% — 150 ₽ и 750 ₽ за 1M, контекст — 1M токенов. Пока скидка идёт, 3.8 стоит столько же, сколько 3.7 Flash. Без скидки она вдвое дороже, так что для задач, где прироста 3.8 не видно, старую модель имеет смысл держать под рукой. У Google действует вводная цена $0,75 и $3,75 за 1M токенов до 31 декабря 2026 года, с января — $1,50 и $7,50. Актуальные цифры по всем моделям — на странице цен. Подписка не нужна, оплата российскими картами в рублях, доступ без VPN.

Попробуй сам

Подставь gemini-3.8-flash вместо gemini-3.7-flash в свой код с base_url=https://gptunnel.ru/v1 и прогони тот же агентный цикл. Сравни две цифры: total_cost и долю задач, доведённых до конца. Или открой Gemini 3.8 Flash в GPTunneL и проверь на своей задаче в чате.