Сбер выложил в open source экспериментальную модель GFusion

Сбер опубликовал первую диффузионную языковую модель GFusion, созданную на основе GigaChat: GFusion-10B-A1.8B-base и GFusion-10B-A1.8B. Как сообщили блогу «Игнатий Цукергохер» в Сбере, проект стал экспериментальной разработкой в одном из самых перспективных направлений генеративного ИИ и будет полезен исследователям, разработчикам и командам, которые хотят создавать собственные диффузионные языковые модели.

Ключевая особенность GFusion в том, что она работает не по классическому авторегрессионному принципу, а по диффузионному сценарию: сначала модель формирует черновик ответа, а затем пошагово его уточняет. Такой подход уже давно используется в генерации изображений и видео, а теперь активно развивается и в текстовых моделях.

Вместе с GFusion Сбер опубликовал инструменты, которые помогают ускорять обучение диффузионных моделей. По словам компании, это первый подобный open source-проект в России. Такие инструменты позволяют обучать модели быстрее и с меньшим числом видеокарт, что особенно важно для исследовательских команд и небольших разработчиков.

Кроме того, команда внесла изменения в SGLang — популярный open source-инструмент для запуска языковых моделей. В него добавили поддержку GFusion и новый алгоритм генерации, который должен улучшить качество работы не только этой модели, но и других диффузионных LLM.

Чем GFusion отличается от классических LLM

Обычные большие языковые модели генерируют текст последовательно — токен за токеном. Это удобно, но есть минус: если модель ошиблась в одном месте, ей приходится пересчитывать весь ответ заново. Диффузионный подход работает иначе. Он позволяет создавать текст параллельно, а не строго слева направо, и быстрее вносить изменения в уже сгенерированный фрагмент.

По тестам Сбера, GFusion работает до 45% быстрее GigaChat 3, на базе которой она обучалась. Это делает диффузионные модели интересными не только с точки зрения исследований, но и для практических сценариев, где важна скорость отклика.

Зачем нужны диффузионные модели

Диффузионные языковые модели могут генерировать токены не по одному, а сразу группами. Это ускоряет процесс и дает больше свободы в построении ответа. Модель сама выбирает, какую часть текста доработать на каждом шаге, поэтому генерация получается менее жесткой, чем у классических LLM.

Еще одно преимущество — более эффективное обучение на ограниченных данных. Диффузионные модели несколько раз проходят по одному и тому же датасету и лучше извлекают из него полезные закономерности. Для исследовательских команд это важно, потому что направление пока остается относительно новым и допускает больше экспериментальных решений.

Кто создал GFusion

Автор проекта — Даниил Тихонов, инженер машинного обучения Сбера. Он пришел в компанию стажером, будучи студентом 4-го курса Факультета компьютерных наук НИУ ВШЭ, и разработал модель в рамках проектной работы. После успешной защиты диплома он остался работать в команде фундаментальных моделей.

История проекта показывает, что Сбер делает ставку не только на зрелые ИИ-продукты, но и на ранние исследовательские направления. Для рынка это важный сигнал: эксперименты в генеративном ИИ все чаще выходят за рамки лабораторий и быстро доходят до open source.

Почему это важно для рынка ИИ

Диффузионные языковые модели считаются одним из самых перспективных направлений генеративного ИИ. По оценке разработчиков, они уже могут использоваться для автодополнения кода в реальном времени, агентных сценариев и приложений, где критична низкая задержка.

Главная задача сейчас — добиться, чтобы диффузионные модели обеспечивали качество ответов и уровень рассуждений, сопоставимый с классическими LLM. Именно поэтому публикация GFusion важна не только как технологический релиз, но и как практический ориентир для рынка.

Что дальше

Сбер подчеркивает, что GFusion — экспериментальный проект, но именно такие релизы обычно задают вектор для дальнейших исследований. Для разработчиков это возможность изучить архитектуру, протестировать инструменты и сравнить диффузионный подход с привычными LLM.

Если направление продолжит развиваться теми же темпами, диффузионные языковые модели могут занять заметное место в задачах, где одновременно важны скорость, гибкость и качество генерации текста.

Принимаем релизы и новости по адресу info@dyvannyi-it.ru