«Е-Флопс» совместно с «АМДтехнологии» разработала высокопроизводительный вычислительный комплекс для задач ИИ. Архитектура предусматривает дальнейшее расширение вычислительных узлов и сетевой инфраструктуры, сообщили блогу Игнатий Цукергохер в пресс-службе «Е-Флопс».
Суперкомпьютер ориентирован на прикладные задачи бизнеса:
- обучение больших языковых моделей в составе MLOps-конвейера,
- запуск и сопровождение LLM-сервисов,
- предоставление доступа к LLM и инструментам вайбкодинга.
В составе комплекса — 22 узла на базе графических ускорителей NVIDIA H100 80GB и x86-процессоров. Пиковая производительность превышает 11 Пфлопс в FP64 и 700 Пфлопс в FP8/INT8. Система включает более 4200 процессорных ядер, почти 34 ТБ оперативной памяти, около 14 ТБ памяти GPU, почти 3 млн ядер CUDA и свыше 92 тыс. тензорных ядер.
Архитектура построена как два физически изолированных сегмента: внутренний, без выхода в интернет, и внешний, доступный для сторонних пользователей. Оба сегмента используют одинаковые серверные платформы, что позволяет при необходимости переключать вычислительные узлы между ними.
- Внутренний сегмент предназначен для ИИ-задач и использует Kubernetes. Он реализован по гиперконвергентной схеме, где каждый узел выполняет вычислительные функции и хранение данных.
- Внешний сегмент рассчитан на ИИ-нагрузки и классические HPC-расчеты с двойной точностью. Во внешнем сегменте предусмотрены три выделенных сервера управления и две выделенные системы хранения данных.
Сетевая инфраструктура разделена на три физические сети.
- Для высокоскоростного обмена используется InfiniBand HDR 200 Гбит/с от каждого GPU, что дает не менее 1600 Гбит/с на узел в одном направлении в топологии Fat Tree.
- Для связи с локальной сетью заказчика применяется 25-гигабитный Ethernet.
- Для управления — 10-гигабитный Ethernet. Во внутреннем сегменте также развернута сеть хранения данных на базе Fibre Channel 32 Гбит/с.
Подсистема хранения данных построена по разным схемам. Во внешнем контуре используется выделенная СХД с иерархическим хранением: SSD объемом 61 ТБ для «горячих» данных и HDD емкостью 2 ПБ для «холодных». Во внутреннем сегменте применяется распределенное гиперконвергентное хранилище с линейным масштабированием.
ПО комплекса включает средства мониторинга и управления, в том числе NVIDIA DCGM, Kubernetes с модулями Multus и Cilium, а также Slurm во внешнем сегменте. Управляющие серверы работают в виртуальной среде Proxmox.
Отдельное внимание уделено ИБ. Оба сегмента размещены в сертифицированном ЦОДе с контролем доступа и разделением холодных и горячих коридоров. Суперкомпьютер уже введен в эксплуатацию в одном из российских банков из топ-10.
«Созданный суперкомпьютер – это не просто мощное оборудование, а интегрированное решение, учитывающее специфику ИИ-задач для финансовой сферы. Главный вызов проекта -эффективно совместить требования крупного бизнеса к высокой производительности, масштабируемости и информационной безопасности в одном решении. Мы готовы и далее наращивать вычислительные мощности вычислительного комплекса»,
— отметила генеральный директор «Е-Флопс» Елена Дорошенко.