Семь моделей на ринге: кто станет интеллектуальным ядром Бауманки?

By in ,
22
Семь моделей на ринге: кто станет интеллектуальным ядром Бауманки?

В МГТУ им. Н.Э. Баумана мы строим не просто очередную цифровую платформу. Мы создаём «Королев ИИ» — интеллектуальное ядро Университета 4.0, нервный узел, который должен пронизывать образование, науку и управление. Но любое ядро требует самого тщательного выбора. Какой «мозг» мы поставим в центр этой системы? Ведь от этого зависит всё: сможет ли платформа понимать сложные инженерные тексты на русском, генерировать гипотезы, помогать студентам и учёным, и при этом оставаться безопасной и контролируемой.

Перед нами стоял жёсткий выбор: облачные проприетарные решения или открытые модели, которые можно развернуть на собственных серверах. Первый путь — быстрый, но полный компромиссов: стоимость, невозможность глубокой кастомизации и, главное, риски для информационной безопасности. Для университета, который работает с критически важными данными и персональной информацией, такой вариант неприемлем. Поэтому мы пошли по второму пути — и устроили настоящее «сражение» больших языковых моделей (LLM) на нашем серверном кластере.

Полигон для испытаний

Для тестирования мы использовали сервер, способный нести до восьми ускорителей NVIDIA H200 с 141 ГБ памяти каждый. Это позволило нам развернуть и прогнать через бенчмарки целый ряд открытых моделей, которые позиционируются как лучшие для работы с русским языком.

Мы оценивали их по нескольким ключевым параметрам:

  • Качество работы с русским языком, особенно в научно-техническом контексте.
  • Архитектура и размер, определяющие, сколько «ума» в модели и какие ресурсы ей нужны.
  • Требования к инфраструктуре — сможет ли модель работать на нашем оборудовании.
  • Лицензионная чистота и возможность до-обучения под наши задачи.
  • Поддержка сообществом и доступность инструментов для тонкой настройки.

Кто вышел на ринг?

В итоге мы сравнили семь ключевых претендентов. Вот краткий портрет каждого.

YaLM‑100B — настоящий гигант от «Яндекса». 100 миллиардов параметров, обучен на двуязычных данных. Его главный козырь — отличное понимание русского языка и способность генерировать длинные, связные тексты. Плата за это — высокие требования к железу: минимум две A100 и около 200 ГБ оперативной памяти.

Vikhr — специализированная модель на базе Llama 3, заточенная именно под русский язык. Считается одной из лучших на русскоязычных бенчмарках. Существует в версиях 8B и 70B параметров, что даёт гибкость в выборе между скоростью и качеством.

Saiga — ещё один сильный «отечественный» игрок, также построенный на Llama 3 и Mistral. Это целое семейство русскоязычных чат-моделей и LoRA-адаптаций. Отличается хорошим балансом качества и требовательности к ресурсам.

Qwen3 — мощные мультиязычные модели от Alibaba (14B и даже 235B параметров). Они хороши в reasoning (рассуждении) и неплохо знают русский, но требуют серьёзных вычислительных мощностей.

Meta‑Llama‑3.1‑8B‑Instruct — базовый «кирпичик» от Meta. Мультиязычная, но для качественной работы на русском требует дообучения. Зато легка в развертывании.

Mistral‑7B — ещё один универсал с открытой лицензией Apache 2.0. Базовое качество русского языка у него среднее, но оно резко вырастает с русскоязычной адаптацией (той же Saiga).

T‑pro 2.0 — компактная «российская» модель, заявляющая об эффективности. Пока что «тёмная лошадка» с не до конца раскрытыми характеристиками.

Многоуровневая стратегия вместо одного «царя»

Главный вывод, который мы сделали: не существует одной-единственной идеальной модели. Наша стратегия — многоуровневая архитектура, где каждая модель решает свой класс задач.

  • Уровень лёгких моделей (7B–14B). Для массовых диалоговых интерфейсов, оперативной поддержки студентов и сотрудников мы выбираем Saiga и Mistral‑7B. Их можно развернуть на периферийных серверах, они дают мгновенный ответ и отлично справляются с повседневными запросами.
  • Уровень тяжелых моделей (70B–100B+). Для сложной аналитики, научного поиска и стратегических рекомендаций мы задействуем Vikhr‑70B или YaLM‑100B. Эти модели работают в высокопроизводительном кластере и включаются по запросу для глубокого семантического анализа больших объёмов данных.
  • Специализированные модели. Для генерации кода, анализа патентов или юридических документов мы подключаем узкоспециализированные решения вроде Qwen‑Coder.

Такой подход даёт нам и скорость, и глубину, и безопасность.

Что дальше? Доменное до-обучение

Мы уже выбрали базовые модели. Но следующий, критически важный этап — доменное дообучение (Domain Adaptation). Мы планируем до-обучать выбранные модели на уникальных корпусах МГТУ: наши учебники, лекции, научные публикации, технические отчёты и архивы кафедр. Только так мы сможем создать по-настоящему интеллектуального ассистента, который понимает специфику именно Бауманки.

Мы уже создали первый рабочий прототип ИИ-ассистента «Королев ИИ» на основе нескольких моделей. Он понимает голос, преобразует его в текст, обрабатывает LLM и даёт ответ естественным голосом. Это только начало.

Впереди — масштабирование, интеграция с платформой «Путь инженера» и превращение «Королев ИИ» в ту самую «нервную систему» Университета 4.0, о которой мы мечтаем.

Следите за обновлениями!