Сбер запускает GigaChat 3.5 Reasoning — нейросеть с уникальным режимом рассуждений

Меньше токенов — лучше результат в сложных задачах

Сбер представил GigaChat 3.5 Reasoning — новую флагманскую мультимодальную нейросеть с режимом рассуждений для решения сложных многоэтапных задач. Модель уже доступна пользователям GigaChat, а разработчики могут бесплатно использовать её по открытой лицензии MIT. Доступ для бизнеса через API обещают открыть в ближайшем будущем.

Источник изображения: Сбер

Ключевое нововведение — способность нейросети не сразу выдавать ответ, а сначала анализировать задачу на отдельные этапы. GigaChat может составить план, определить, какая информация отсутствует, подключить поиск или внешние инструменты, проверить промежуточные результаты и скорректировать решение, если обнаружит ошибку.

Режим рассуждений активируется отдельной кнопкой. Для простых запросов модель может отвечать без продолжительного анализа, а при решении особенно сложных задач расходовать десятки тысяч токенов. Такой метод ориентирован в первую очередь на программирование, аналитику и агентные сценарии, в которых нейросети необходимо самостоятельно выполнять последовательность связанных действий.

Например, при планировании поездки GigaChat может запросить недостающие параметры, подобрать авиабилет и гостиницу, проверить соответствие маршрута заданному бюджету и внести изменения в первоначальный план, если выявит противоречия. Среди других сценариев Сбер упоминает поиск ошибок в коде, выявление несоответствий в юридических документах, финансовые расчеты, планирование логистики и анализ научных данных.

Основой для новой модели послужила GigaChat 3.5 Ultra. Во время обучения нейросеть решала математические и программные задачи несколькими способами, разбивая их на последовательные шаги. Затем автоматическая проверка отбирала успешные варианты рассуждений, которые использовались для дальнейшего обучения. Благодаря этому модель должна была научиться не только разрабатывать план решения, но и осознавать, когда необходимо обратиться к внешнему инструменту или пересмотреть предыдущий шаг.

Сбер сообщает о заметном улучшении результатов в ряде тестов. В IFBench показатель увеличился с 44 до 77 баллов, в Natural Plan — с 64 до 80, а в Live Code Bench v6 — с 56 до 85 баллов по сравнению с вариантом без режима рассуждений. По оценке разработчиков, GigaChat 3.5 Ultra Reasoning приблизилась к передовым зарубежным моделям в задачах, связанных с выполнением сложных инструкций, планированием и программированием.

По данным Сбера, при сопоставимом качестве GigaChat 3.5 Reasoning использует меньше токенов для промежуточных рассуждений, чем некоторые открытые конкуренты. В частности, при решении математических задач заявлено среднее преимущество в 37% по сравнению с DeepSeek V4 Flash Preview.

Источник
Оцените статью
Эхо мира