В МГТУ им. Н.Э. Баумана мы строим не просто очередную цифровую платформу. Мы создаём «Королев ИИ» — интеллектуальное ядро Университета 4.0, нервный узел, который должен пронизывать образование, науку и управление. Но любое ядро требует самого тщательного выбора. Какой «мозг» мы поставим в центр этой системы? Ведь от этого зависит всё: сможет ли платформа понимать сложные инженерные тексты на русском, генерировать гипотезы, помогать студентам и учёным, и при этом оставаться безопасной и контролируемой.
Перед нами стоял жёсткий выбор: облачные проприетарные решения или открытые модели, которые можно развернуть на собственных серверах. Первый путь — быстрый, но полный компромиссов: стоимость, невозможность глубокой кастомизации и, главное, риски для информационной безопасности. Для университета, который работает с критически важными данными и персональной информацией, такой вариант неприемлем. Поэтому мы пошли по второму пути — и устроили настоящее «сражение» больших языковых моделей (LLM) на нашем серверном кластере.
Полигон для испытаний
Для тестирования мы использовали сервер, способный нести до восьми ускорителей NVIDIA H200 с 141 ГБ памяти каждый. Это позволило нам развернуть и прогнать через бенчмарки целый ряд открытых моделей, которые позиционируются как лучшие для работы с русским языком.
Мы оценивали их по нескольким ключевым параметрам:
- Качество работы с русским языком, особенно в научно-техническом контексте.
- Архитектура и размер, определяющие, сколько «ума» в модели и какие ресурсы ей нужны.
- Требования к инфраструктуре — сможет ли модель работать на нашем оборудовании.
- Лицензионная чистота и возможность до-обучения под наши задачи.
- Поддержка сообществом и доступность инструментов для тонкой настройки.
Кто вышел на ринг?
В итоге мы сравнили семь ключевых претендентов. Вот краткий портрет каждого.
YaLM‑100B — настоящий гигант от «Яндекса». 100 миллиардов параметров, обучен на двуязычных данных. Его главный козырь — отличное понимание русского языка и способность генерировать длинные, связные тексты. Плата за это — высокие требования к железу: минимум две A100 и около 200 ГБ оперативной памяти.
Vikhr — специализированная модель на базе Llama 3, заточенная именно под русский язык. Считается одной из лучших на русскоязычных бенчмарках. Существует в версиях 8B и 70B параметров, что даёт гибкость в выборе между скоростью и качеством.
Saiga — ещё один сильный «отечественный» игрок, также построенный на Llama 3 и Mistral. Это целое семейство русскоязычных чат-моделей и LoRA-адаптаций. Отличается хорошим балансом качества и требовательности к ресурсам.
Qwen3 — мощные мультиязычные модели от Alibaba (14B и даже 235B параметров). Они хороши в reasoning (рассуждении) и неплохо знают русский, но требуют серьёзных вычислительных мощностей.
Meta‑Llama‑3.1‑8B‑Instruct — базовый «кирпичик» от Meta. Мультиязычная, но для качественной работы на русском требует дообучения. Зато легка в развертывании.
Mistral‑7B — ещё один универсал с открытой лицензией Apache 2.0. Базовое качество русского языка у него среднее, но оно резко вырастает с русскоязычной адаптацией (той же Saiga).
T‑pro 2.0 — компактная «российская» модель, заявляющая об эффективности. Пока что «тёмная лошадка» с не до конца раскрытыми характеристиками.
Многоуровневая стратегия вместо одного «царя»
Главный вывод, который мы сделали: не существует одной-единственной идеальной модели. Наша стратегия — многоуровневая архитектура, где каждая модель решает свой класс задач.
- Уровень лёгких моделей (7B–14B). Для массовых диалоговых интерфейсов, оперативной поддержки студентов и сотрудников мы выбираем Saiga и Mistral‑7B. Их можно развернуть на периферийных серверах, они дают мгновенный ответ и отлично справляются с повседневными запросами.
- Уровень тяжелых моделей (70B–100B+). Для сложной аналитики, научного поиска и стратегических рекомендаций мы задействуем Vikhr‑70B или YaLM‑100B. Эти модели работают в высокопроизводительном кластере и включаются по запросу для глубокого семантического анализа больших объёмов данных.
- Специализированные модели. Для генерации кода, анализа патентов или юридических документов мы подключаем узкоспециализированные решения вроде Qwen‑Coder.
Такой подход даёт нам и скорость, и глубину, и безопасность.
Что дальше? Доменное до-обучение
Мы уже выбрали базовые модели. Но следующий, критически важный этап — доменное дообучение (Domain Adaptation). Мы планируем до-обучать выбранные модели на уникальных корпусах МГТУ: наши учебники, лекции, научные публикации, технические отчёты и архивы кафедр. Только так мы сможем создать по-настоящему интеллектуального ассистента, который понимает специфику именно Бауманки.
Мы уже создали первый рабочий прототип ИИ-ассистента «Королев ИИ» на основе нескольких моделей. Он понимает голос, преобразует его в текст, обрабатывает LLM и даёт ответ естественным голосом. Это только начало.
Впереди — масштабирование, интеграция с платформой «Путь инженера» и превращение «Королев ИИ» в ту самую «нервную систему» Университета 4.0, о которой мы мечтаем.
Следите за обновлениями!

