10 сентября Сбер представил GigaChat 3.5 Reasoning — новую версию своей нейросети с режимом рассуждений. В сообщении компании утверждалось, что по ключевым направлениям — следованию сложным инструкциям, планированию и написанию кода — модель «вплотную приблизилась к лучшим мировым моделям». В качестве подтверждения Сбер привел рост собственных результатов: 77 баллов в IFBench, 80 — в Natural Plan и 85 — в Live Code Bench v6.
Однако более широкая картина выглядит заметно скромнее. В новом российском бенчмарке MERA Text 2.0 именно GigaChat3.5-432B-A28B-Reasoning по состоянию на середину сентября занимает 13-е место с результатом 0,423. Первое место у Gemini 3.7 Flash — 0,678, далее идут GPT 5.6 Sol с 0,639, Claude Opus 5 с 0,631 и Grok 4.6 с 0,623. Таким образом, даже на русскоязычной площадке разрыв между GigaChat и верхней частью рейтинга остается существенным.
Интересно и то, как устроено сравнение в материалах самого Сбера. В опубликованной карточке GigaChat 3.5 Reasoning основным зарубежным соперником выступает DeepSeek V4 Flash Preview. Российская модель действительно выигрывает у него в отдельных тестах: например, в AIME 2025 и AIME 2026, IFBench и StructEval, а также в нескольких сравнительных тестах диалоговых ответов. Но по целому ряду других задач DeepSeek впереди. На GPQA-Diamond его результат составляет 87,4 против 82,32 у GigaChat, на Natural Plan — 88 против 80,19, на Live Code Bench — 87,87 против 85,4, на SWE-bench Verified — 78,6 против 64,7, а на Terminal-Bench 2 — 56,6 против 30,3. Средний показатель в опубликованной самим разработчиком таблице — 72,71 у DeepSeek и 68,88 у GigaChat.
При этом цифры, вынесенные Сбером в публичное сообщение о релизе, прежде всего показывают, насколько новая GigaChat стала лучше предыдущей версии, а не насколько она сильнее мировых лидеров. Так, результат Live Code Bench вырос с 56 до 85 баллов — действительно резкий скачок. Но выбранный для сравнения DeepSeek в той же таблице получает почти 88. В Natural Plan рост составляет с 64 до 80 баллов, тогда как у DeepSeek — 88. Поэтому формулировка о приближении к лидерам справедлива для отдельных задач, но превращать ее в общую характеристику возможностей модели оснований значительно меньше.
В марте 2025 года, представляя GigaChat 2.0, банк объявил, что создал модель «на уровне лучших мировых решений», а в задачах на русском языке она превосходит большинство зарубежных конкурентов. В материалах релиза GigaChat 2 MAX сопоставляли с GPT-4o, DeepSeek-V3, Qwen2.5 и LLaMA 70B и ссылались на первое место в MERA.
В годовом отчете Сбера GigaChat MAX также назывался «одной из сильнейших моделей в мире» со ссылкой на «независимый бенчмарк MERA». MERA — открытый проект Альянса в сфере искусственного интеллекта, в создании и развитии которого участвуют российские технологические компании и научные организации. Среди партнеров указаны SberDevices и Sber AI, а Сбер был одним из учредителей Альянса. Председателем наблюдательного совета Альянса является первый заместитель председателя правления Сбербанка Александр Ведяхин. Это само по себе не делает результаты MERA недостоверными: код и методология проекта открыты, в работе участвуют и другие компании и научные организации. Но называть такую оценку полностью внешней по отношению к Сберу можно лишь с существенной оговоркой.
Красивую формулу Сбера о «мировом уровне» GigaChat теперь фактически поддержал и вице-премьер Дмитрий Чернышенко. Он заявил, что российские ИИ-модели уже сопоставимы по параметрам с ведущими зарубежными разработками, отдельно упомянув GigaChat 3.5 и «Алису» от «Яндекса». Однако такая оценка скорее повторяет маркетинговую риторику разработчиков, чем отражает общую картину независимых тестов. Отечественные модели действительно быстро развиваются и в отдельных задачах способны показывать сильные результаты, но по совокупности бенчмарков пока заметно уступают лидерам мирового рынка.
GigaChat 3.5 Reasoning — крупная открытая модель на 432 млрд параметров, из которых при работе задействуются 28 млрд. Сбер опубликовал ее под лицензией MIT. Модель заметно прибавила в математике, программировании, работе с инструкциями и русскоязычными задачами и по отдельным тестам действительно конкурирует с сильными зарубежными решениями.
Проблема скорее в масштабе вывода. Доступные результаты не показывают, что GigaChat в целом находится на одном уровне с сильнейшими моделями OpenAI, Anthropic, Google и другими лидерами рынка. Между реальным технологическим прогрессом GigaChat и его маркетинговым позиционированием остается заметная дистанция: отдельные победы в бенчмарках превращаются в заявления о мировом уровне, хотя совокупность тех же тестов такой вывод пока не подтверждает. Поэтому заявления о фактическом паритете выглядят скорее как попытка выдать желаемое за действительное: технологический прогресс есть, но до устойчивого равенства с сильнейшими зарубежными системами еще далеко.
В более широком контексте Россия пока скорее пытается догонать крупнейших игроков мировой ИИ-гонки. Особенно заметен разрыв не в практической интеграции ИИ в сложные военные и разведывательные системы. Американская Palantir, например, уже несколько лет работает с Украиной: ее технологии используются для анализа разведданных и ударов, а в 2026 году компания подключилась к развитию систем на основе боевых данных для обнаружения и перехвата российских беспилотников.
