Перейти к содержимому

GigaChat, YandexGPT или зарубежная модель: выбор по ограничениям, а не по бенчмаркам

Константин Потапов
9 мин

Сравнивать модели по таблицам бенчмарков бесполезно: ваша задача в них не измерялась. Четыре ограничения, которые реально решают выбор, и способ проверить кандидатов за один день на своих данных.

Вопрос «какая модель лучше» задают чаще всего, и он почти всегда бесполезен. Не потому что глупый, а потому что «лучше» измеряется на чужих задачах.

Бенчмарки меряют способность решать олимпиадные задачки, писать код и отвечать на вопросы по школьной программе. Ваша задача разобрать заявку от клиента, который пишет без знаков препинания, и понять, что он хочет вернуть товар. Корреляция между первым и вторым есть, но она слабее, чем кажется, и на ней нельзя строить решение стоимостью в полмиллиона.

Выбор решается четырьмя ограничениями. Разбирать их надо в этом порядке, потому что каждое следующее имеет смысл только после предыдущего.

Ограничение первое: что вообще можно

Это не вопрос вкуса, а вопрос того, какие данные уходят наружу и куда именно. Если в промпт попадают персональные данные, зарубежный провайдер отпадает сразу, со всеми последствиями трансграничной передачи и локализации. Подробно про то, где именно данные утекают и как этого избежать инженерно, я писал отдельно.

Практически из этого вытекают три варианта: обезличить данные до вызова и тогда провайдер не важен; взять российского провайдера; поднять открытую модель в своём контуре.

Пока это ограничение не закрыто, остальные три обсуждать рано. Я видел проекты, где модель выбирали три недели по качеству, а потом переигрывали за день, когда до разговора дошёл юрист.

Ограничение второе: цена на вашем объёме

Здесь начинается арифметика, и она отличается от впечатления от прайса.

Ориентиры на середину 2026 года. GigaChat в тарифе Lite стоит 0,065 ₽ за тысячу токенов в синхронном режиме, GigaChat-2-Pro примерно 5 ₽ за десять тысяч. YandexGPT Lite 5 около 2 ₽ за десять тысяч, Pro 5.1 около 8 ₽. По API Yandex Cloud вилка в целом от 0,40 до 3,00 ₽ за тысячу.

Разница между Lite и Pro примерно порядок. И вот главное: на узкой задаче Lite часто справляется не хуже. Классификация обращения по десяти категориям, извлечение шести полей из накладной, определение тональности это не то, где нужна модель, умеющая рассуждать о философии.

Отсюда практическое правило: начинайте с дешёвой модели и проверяйте, где она ломается. Переход на дорогую это решение, которое надо заслужить конкретным списком случаев, а не взять по умолчанию «чтобы точно хватило».

Обратите внимание и на размер контекстного окна: у YandexGPT 5 Pro это 32 тысячи токенов. Если вы собирались подавать в промпт документ на сто страниц, ограничение всплывёт не на демо, а на реальных данных.

Ограничение третье: качество на ваших данных

Единственный способ узнать это проверить. Это делается за день, и я не понимаю, почему это делают так редко.

Как:

  1. Соберите пятьдесят реальных случаев. Не выдуманных примеров, а того, что действительно приходило: с опечатками, обрывками, вложениями не в том формате, тремя вопросами в одном сообщении.
  2. Разметьте правильные ответы руками. Это самая скучная часть, и её нельзя пропустить: без разметки сравнивать не с чем.
  3. Прогоните всех кандидатов по одному и тому же промпту.
  4. Посчитайте не «в целом неплохо», а число: сколько попаданий, сколько ошибок, сколько отказов.

Пятьдесят примеров это не научная выборка, и она вам не нужна. Разница между «эта модель годится» и «эта не годится» на пятидесяти случаях видна невооружённым глазом. Если не видна, значит модели равны, и выбирайте по цене.

Отдельно смотрите не на среднее качество, а на характер ошибок. Модель, которая в спорных случаях отвечает «не уверен», сильно дешевле в эксплуатации, чем модель с той же точностью, но уверенно врущая в оставшихся процентах. Первую можно завернуть на человека. Вторую вы обнаружите в жалобе клиента.

Ограничение четвёртое: что будет, когда провайдер обновит модель

Про это не думают до первого раза.

Провайдер обновляет модель под тем же именем, и ваш промпт, вылизанный за две недели, начинает работать иначе. Иногда лучше. Иногда качество проседает на конкретном типе входа, и вы узнаёте об этом через месяц по накопившимся жалобам.

Защита простая и всё та же: те самые пятьдесят размеченных примеров, которые гоняются по расписанию. Плюс архитектурное решение: не привязывать код к одному провайдеру. Слой, за которым скрыт конкретный API, стоит одного дня работы и окупается в момент, когда придётся переезжать. А переезжать придётся: за последние два года у этого рынка не было ни одного спокойного полугодия.

Когда своя модель в своём контуре

Вариант, который недооценивают. Открытая модель на своём железе или в приватном облаке: данные не покидают периметр вообще, стоимость вызова стремится к стоимости электричества, провайдер ничего не обновит без вашего ведома.

Цена это эксплуатация. GPU, инференс-сервер, мониторинг, поведение под нагрузкой и человек, который всё это держит. Для узкой задачи (классификация, извлечение полей, поиск по базе) открытые модели давно достаточны, и вариант рабочий. Для «ассистента, который понимает всё», обычно нет.

Считать надо так: если объём большой и задача узкая, свой контур окупается. Если объём маленький, платить за GPU круглосуточно ради тысячи запросов в день дороже, чем API.

Что делать в понедельник

Ответьте на первый вопрос: уходят ли наружу персональные данные. Если да, сузьте список до российских провайдеров или своего контура, и только потом сравнивайте.

Дальше соберите пятьдесят реальных случаев и прогоните по ним двух кандидатов на самых дешёвых тарифах. День работы, расходы на токены рублей триста.

Всё, что вы прочитаете про модели за этот же день, будет менее полезно, чем эта таблица из пятидесяти строк.

Похожие материалы

·7 мин

Три котёнка ищут дом: как я собрал объявление с агентом в Telegram

Подруге из Витебска нужно пристроить трёх котят. На входе абзац и восемь фотографий, на выходе комплект: текст, площадки, порядок снимков, напоминание админам и вопросы будущим хозяевам. Что сделал Hermes и что остаётся людям.

·10 мин

Сотни записей с обхода здания в дефектовку за ночь

Многоэтажный объект, десятки гигабайт записей с обхода и одна ночь на отчёт. Как я собрал сотни замечаний с кадрами в XLSX-шаблонах заказчика: локальный Whisper, кэш по SHA-256, ручная проверка и никаких выдуманных объёмов.

·11 мин

Квота на 95 писем и одно письмо: постмортем ночного SIGBUS в celery

Разбор ночного инцидента на Tech Path Finder по обычному каркасу: коротко, хронология, пять «почему», что сработало, пункты. Healthcheck трое суток заводил себе комплекты mmap-файлов prometheus_client, tmpfs кончилась, форки celery пошли умирать с SIGBUS, задачи с acks_late закружились в очереди, и дневная квота писем сгорела за полторы минуты.