Центр ИИ МТС (MWS AI) совместно с KOREATECH разработал фильтр для LLM — Agreement Validation Interface (AVI). Решение позволяет настраивать модель с учётом требований безопасности, законодательства и отраслевых регламентов с использованием естественного языка. Инструмент опубликован на GitHub и, по данным разработчиков, сокращает время переобучения до 10 дней, сообщили блогу Игнатий Цукергохер в пресс-службе MWS AI.
AVI работает как внешний слой между пользователем и моделью и не требует изменений в самой LLM. На этапе запроса система блокирует обращения с запрещёнными темами, провокациями и попытками получения персональных данных. На этапе ответа фильтр отсекает токсичный контент, дезинформацию и утечки данных.
Настройка правил выполняется без программирования, что позволяет привлекать специалистов из юридических, финансовых и комплаенс-подразделений.
В тестировании на выборке более 2 тыс. русскоязычных запросов фильтр выявил 98,5% опасных обращений, включая экстремизм, разжигание ненависти, попытки получения персональных данных, призывы к суициду и незаконным действиям. При обнаружении нарушений генерация ответа прерывается. По данным разработчиков, использование фильтра ускоряет реакцию системы почти в четыре раза; повторные запросы обрабатываются за доли секунды.
Архитектура AVI совместима с любыми большими языковыми моделями. Исходный код фильтра доступен на GitHub. В репозитории находится образец использования фильтра на Python и FastAPI, конфигурации для векторной базы данных Qdrant.
«Управление корпоративным ИИ сегодня — про то, как быстро компания подстроит модель под новое требование или риск, не переобучая ее с нуля. Именно в эту сторону сейчас движутся исследования по всему миру», – отметила профессор Korea University of Technology and Education (Южная Корея), руководитель Global Academia and Research Hub и Digital Professor в НИУ ВШЭ Ольга Швецова.