Все модели Yandex Cloud AI Studio: цены и честные оценки
Откуда список и цены
Список — не с маркетинговых страниц, а прямой запрос к API: GET https://ai.api.cloud.yandex.net/v1/models с обычным Api-Key возвращает все модели, доступные вашему каталогу. Таких моделей оказалось 26 (с учётом legacy- и rc-версий). Цены — из официального прайса Yandex AI Studio для региона Россия, с НДС, за 1000 токенов; актуальны на август 2026 года.
Оценка «годности» — моя субъективная шкала от 0 («на фиг не нужна») до 5 («великолепна»), методика в конце статьи.
Набор моделей у конкретного каталога может отличаться — зависит от прав и региона. Проверить свой: curl -H "Authorization: Api-Key <ключ>" https://ai.api.cloud.yandex.net/v1/models
Текстовые модели, по возрастанию цены
Синхронный режим, ₽ за 1000 токенов. «Кэш» — цена кешированных входящих токенов (повторная передача инструкции без пересчёта).
| Модель | Вход | Выход | Кэш | Что умеет | Оценка |
|---|---|---|---|---|---|
| gpt-oss-20b | 0,10 | 0,10 | 0,10 | Открытая модель OpenAI: рассуждения, вызов инструментов, контекст ~131K. Русский — средненько | ★★★☆☆ |
| Alice AI LLM Flash | 0,10 | 0,20 | 0,025 | Лёгкая версия флагмана Алисы: чат, черновики, агенты. С кэшем — почти даром | ★★★★☆ |
| Speech Realtime 260528 | 0,10 | 0,20 | 0,025 | Голосовая модель реального времени (Realtime API): речь ↔ речь с минимальной задержкой | ★★★☆☆ |
| YandexGPT Lite | 0,20 | 0,20 | 0,20 | Рабочая лошадка: массовые задачи, классификация, суммаризация. В async — 0,10 ₽ | ★★★★☆ |
| Qwen3.6 35B A3B | 0,20 | 0,30 | 0,05 | MoE (35B параметров, ~3B активных). Быстрая, дешёвая и понимает картинки — моё основное зрение | ★★★★★ |
| gpt-oss-120b | 0,30 | 0,30 | 0,30 | Старший брат gpt-oss-20b: сильные рассуждения и код. Русский заметно хуже английского | ★★★★☆ |
| DeepSeek V4 Flash | 0,30 | 0,50 | 0,075 | Контекст до 1 млн токенов, код, многошаговые рассуждения. Цена/качество — вне конкуренции | ★★★★★ |
| Qwen3 235B A22B FP8 | 0,50 | 0,50 | 0,50 | Большой MoE для агентных сценариев и сложных инструкций; цена входа = цене выхода | ★★★★☆ |
| DeepSeek V3.2 | 0,50 | 0,80 | 0,13 | Код, агентные сценарии, рассуждения. В прайсе есть, но в /v1/models не показывается — загадка |
★★★★☆ |
| YandexGPT Pro 5.1 | 0,80 | 0,80 | 0,80 | Лучший «русский» Pro: RAG, анализ документов, аккуратный стиль. В async — вдвое дешевле | ★★★★☆ |
| Speech Realtime 250923 | 0,80 | 0,80 | 0,20 | Предыдущая голосовая модель. Работает, но наследник 260528 делает то же в 8 раз дешевле | ★★☆☆☆ |
| Alice AI LLM | 0,50 | 1,20 | 0,50 | Флагман Алисы: сложные задачи и живой чат на русском. Единственная модель с дорогим выходом | ★★★★☆ |
| YandexGPT Pro 5 | 1,20 | 1,20 | 1,20 | Прошлое поколение Pro: 5.1 лучше и дешевле. Брать только ради совместимости | ★★☆☆☆ |
Голоса и легаси
В списке API также висят speech-realtime-deepseek-v4-flash (голосовой агент с мозгами DeepSeek V4 Flash, отдельной цены в прайсе нет) и версии /deprecated и /rc у YandexGPT — это легаси для старых клиентов и предрелизные срезы. Первым — ★☆☆☆☆ (мигрируйте), вторым — ★★☆☆☆ (для экспериментов).
Асинхронный режим — вдвое дешевле
Для четырёх моделей Яндекса есть async-режим (запрос через очередь, ответ не мгновенно):
| Модель | Вход | Выход |
|---|---|---|
| YandexGPT Lite | 0,10 | 0,10 |
| YandexGPT Pro 5.1 | 0,41 | 0,41 |
| YandexGPT Pro 5 | 0,61 | 0,61 |
| Alice AI LLM | 0,25 | 1,02 |
Пакетный режим и выделенные инстансы
Открытые модели доступны в пакетном режиме (batch) от 0,10 до 6,10 ₽ за 1000 токенов — Qwen3-8B/14B/32B, Llama-3.3-70B, phi-4, дистилляты DeepSeek-R1, VL-модели от 0,10 ₽, Gemma3 27B it за 0,41 ₽. Минимальный запуск — 200 000 токенов, зато цена не зависит от направления (вход = выход).
Совсем особый случай — T-pro-it-2.0-FP8 (модель Т-Банка): она доступна только как выделенный инстанс, от 756 ₽/час за конфигурацию S. Как и Qwen 2.5 72B / VL 32B (от 817 ₽/час) и Gemma 3 4B/12B (от 409 ₽/час). Это уже территория «арендуем железо», а не «платим за токены».
Эмбеддинги
Все векторные модели — text-search-doc/query, text-embeddings-v2-doc/query, старый text-embeddings — тарифицируются одинаково: 0,0101 ₽ за 1000 токенов. Основа любого RAG по копеечной цене.
Оценка: ★★★★★ — дешевле только даром.
Генерация изображений — YandexART
2,23 ₽ за запрос генерации картинки (не идемпотентных: два одинаковых промпта = два запроса). На платформе это единственный вариант генерации изображений, и он же рисует обложки этого блога.
Оценка: ★★★★☆ — качество хорошее, но конкуренции внутри платформы нет, а хочется.
Классификация
Готовые классификаторы: 0,1525 ₽ за запрос (до 1000 токенов на Lite, до 250 — на Pro или дообученном классификаторе). Полезно для маршрутизации тикетов и модерации.
Как я ставил оценки
- 5 — великолепна: лучший выбор в своём классе, сам использую и не хочу менять.
- 4 — хороша: крепкая рабочая модель, берите смело, если подходит под задачу.
- 3 — нишевая: для своих задач неплохо, но либо узкая специализация, либо есть вопросы к качеству.
- 2 — слабая: есть прямой конкурент на той же платформе, который лучше и/или дешевле.
- 1 — легаси: существует для совместимости, новым проектам не трогать.
- 0 — не нашлось: нулей никто не получил, даже deprecated-версии — они хотя бы работают.
Оценки субъективны: я смотрю на соотношение цены и качества, качество русского языка, пригодность к агентным сценариям (вызов инструментов) и личный опыт — часть моделей крутится в моих же инструментах.
Итоги
- Лучшая покупка вообще — DeepSeek V4 Flash: миллион контекста, код и рассуждения за 0,30–0,50 ₽.
- Лучшее зрение за деньги — Qwen3.6 35B A3B: картинки понимает, стоит как Lite.
- Массовые задачи — YandexGPT Lite, особенно в async и пакетном режимах.
- Русскоязычный Pro — YandexGPT Pro 5.1, но берите его в async за 0,41 ₽.
- Анти-топ — YandexGPT Pro 5 (уступает 5.1 во всём, кроме номера) и Speech Realtime 250923 (есть наследник в 8 раз дешевле).
Цены меняются, модели добавляются — перед серьёзными тратами сверяйтесь с /v1/models и официальным прайсом.
Комментарии
Пока нет комментариев.
Войдите, чтобы комментировать.