Перейти к содержимому

GigaChat, YandexGPT или зарубежная модель: выбор по ограничениям, а не по бенчмаркам

Константин Потапов
9 мин

Сравнивать модели по таблицам бенчмарков бесполезно: ваша задача в них не измерялась. Четыре ограничения, которые реально решают выбор, и способ проверить кандидатов за один день на своих данных.

Вопрос «какая модель лучше» задают чаще всего, и он почти всегда бесполезен. Не потому что глупый, а потому что «лучше» измеряется на чужих задачах.

Бенчмарки меряют способность решать олимпиадные задачки, писать код и отвечать на вопросы по школьной программе. Ваша задача — разобрать заявку от клиента, который пишет без знаков препинания, и понять, что он хочет вернуть товар. Корреляция между первым и вторым есть, но она слабее, чем кажется, и на ней нельзя строить решение стоимостью в полмиллиона.

Выбор решается четырьмя ограничениями. Разбирать их надо в этом порядке, потому что каждое следующее имеет смысл только после предыдущего.

Ограничение первое: что вообще можно

Это не вопрос вкуса, а вопрос того, какие данные уходят наружу и куда именно. Если в промпт попадают персональные данные, зарубежный провайдер отпадает сразу — со всеми последствиями трансграничной передачи и локализации. Подробно про то, где именно данные утекают и как этого избежать инженерно, я писал отдельно.

Практически из этого вытекают три варианта: обезличить данные до вызова и тогда провайдер не важен; взять российского провайдера; поднять открытую модель в своём контуре.

Пока это ограничение не закрыто, остальные три обсуждать рано. Я видел проекты, где модель выбирали три недели по качеству, а потом переигрывали за день, когда до разговора дошёл юрист.

Ограничение второе: цена на вашем объёме

Здесь начинается арифметика, и она отличается от впечатления от прайса.

Ориентиры на середину 2026 года. GigaChat в тарифе Lite — 0,065 ₽ за тысячу токенов в синхронном режиме, GigaChat-2-Pro — примерно 5 ₽ за десять тысяч. YandexGPT Lite 5 — около 2 ₽ за десять тысяч, Pro 5.1 — около 8 ₽. По API Yandex Cloud вилка в целом от 0,40 до 3,00 ₽ за тысячу.

Разница между Lite и Pro — примерно порядок. И вот главное: на узкой задаче Lite часто справляется не хуже. Классификация обращения по десяти категориям, извлечение шести полей из накладной, определение тональности — это не то, где нужна модель, умеющая рассуждать о философии.

Отсюда практическое правило: начинайте с дешёвой модели и проверяйте, где она ломается. Переход на дорогую — решение, которое надо заслужить конкретным списком случаев, а не взять по умолчанию «чтобы точно хватило».

Обратите внимание и на размер контекстного окна: у YandexGPT 5 Pro это 32 тысячи токенов. Если вы собирались подавать в промпт документ на сто страниц, ограничение всплывёт не на демо, а на реальных данных.

Ограничение третье: качество на ваших данных

Единственный способ узнать — проверить. Это делается за день, и я не понимаю, почему это делают так редко.

Как:

  1. Соберите пятьдесят реальных случаев. Не выдуманных примеров, а того, что действительно приходило: с опечатками, обрывками, вложениями не в том формате, тремя вопросами в одном сообщении.
  2. Разметьте правильные ответы руками. Это самая скучная часть, и её нельзя пропустить: без разметки сравнивать не с чем.
  3. Прогоните всех кандидатов по одному и тому же промпту.
  4. Посчитайте не «в целом неплохо», а число: сколько попаданий, сколько ошибок, сколько отказов.

Пятьдесят примеров — не научная выборка, и она вам не нужна. Разница между «эта модель годится» и «эта не годится» на пятидесяти случаях видна невооружённым глазом. Если не видна — значит модели равны, и выбирайте по цене.

Отдельно смотрите не на среднее качество, а на характер ошибок. Модель, которая в спорных случаях отвечает «не уверен», сильно дешевле в эксплуатации, чем модель с той же точностью, но уверенно врущая в оставшихся процентах. Первую можно завернуть на человека. Вторую вы обнаружите в жалобе клиента.

Ограничение четвёртое: что будет, когда провайдер обновит модель

Про это не думают до первого раза.

Провайдер обновляет модель под тем же именем, и ваш промпт, вылизанный за две недели, начинает работать иначе. Иногда лучше. Иногда качество проседает на конкретном типе входа, и вы узнаёте об этом через месяц по накопившимся жалобам.

Защита простая и всё та же: те самые пятьдесят размеченных примеров, которые гоняются по расписанию. Плюс архитектурное решение — не привязывать код к одному провайдеру. Слой, за которым скрыт конкретный API, стоит одного дня работы и окупается в момент, когда придётся переезжать. А переезжать придётся: за последние два года у этого рынка не было ни одного спокойного полугодия.

Когда своя модель в своём контуре

Вариант, который недооценивают. Открытая модель на своём железе или в приватном облаке: данные не покидают периметр вообще, стоимость вызова стремится к стоимости электричества, провайдер ничего не обновит без вашего ведома.

Цена — эксплуатация. GPU, инференс-сервер, мониторинг, поведение под нагрузкой и человек, который всё это держит. Для узкой задачи — классификация, извлечение полей, поиск по базе — открытые модели давно достаточны, и вариант рабочий. Для «ассистента, который понимает всё» — обычно нет.

Считать надо так: если объём большой и задача узкая, свой контур окупается. Если объём маленький, платить за GPU круглосуточно ради тысячи запросов в день дороже, чем API.

Что делать в понедельник

Ответьте на первый вопрос: уходят ли наружу персональные данные. Если да — сузьте список до российских провайдеров или своего контура, и только потом сравнивайте.

Дальше соберите пятьдесят реальных случаев и прогоните по ним двух кандидатов на самых дешёвых тарифах. День работы, расходы на токены — рублей триста.

Всё, что вы прочитаете про модели за этот же день, будет менее полезно, чем эта таблица из пятидесяти строк.

Похожие материалы

·10 мин

ИИ и 152-ФЗ: инженерный разбор вместо юридического

Про LLM и персональные данные пишут юристы и облачные провайдеры. Разбираю то, о чём они не пишут: три архитектурные развилки, обезличивание, которое не делается регулярками, и персональные данные, оседающие в логах вокруг модели.

·9 мин

Разбор Aginx: LLM-пайплайн, который собирает ролик за 5 минут и 250 рублей

Разбор экспериментального контура «бриф → сценарий → медиа → монтаж»: Pydantic вместо магии, fallback провайдеров, 250 ₽ на ролик и грабли от бана ElevenLabs до субтитров без таймстемпов.

·11 мин

Демо работало, прод не поехал: что ломается между пилотом ИИ и рабочей системой

Исследование MIT NANDA: 95% корпоративных ИИ-пилотов не дают измеримого эффекта. Разбираю инженерную половину проблемы — шесть вещей, которых нет в демо и без которых контур не живёт дольше трёх недель.