Яндекс возвращается в гонку за суверенность (спойлер: никуда и не уходил) В июле Герман Греф говорил, что единственная полностью отечественная большая языковая модель в России есть у Сбера, а «Яндекс» лишь дообучает китайскую Qwen. В Яндексе слова Грефа опровергали и заявляли, что используют прагматичный для бизнеса подход и берут лучшее из доступного: как опенсорс, так и обученные с нуля собственные модели. Работа над последними, по словам компании, никогда не останавливалась. Как минимум, на их основе всегда работали ИИ-ответы в Поиске. Вслед за публикацией Alice AI Search Pretrain «Яндекс» представил Alice AI Foundation — ещё одну большую модель компании, обученную с нуля без использования сторонних весов. В ней 80 млрд параметров, из которых при работе активны 3 млрд. На обучение примерно на 18 трлн токенов ушло около полугода. Параметры модели, код архитектуры и токенизатор опубликованы под Apache 2.0. Пообщались с руководителем архитектуры претрейна Максимом Абрахамом на полях Practical ML Conf и ознакомились с почти 90-страничным техническим отчётом — документ предоставили специально для @anti_agi. На что обратили внимание: 📍 Модель суверенная, но не изолированная. Дистилляции от Kimi или другой зарубежной модели, по словам Абрахама, не было. Начальные параметры генерировались случайно, а весь цикл обучения прошёл внутри «Яндекса». При разработке этой модели команда изучала все лучшие доступные подходы. В первых экспериментах команда тестировала архитектуру Qwen3-Next, а затем заменила её собственной архитектурой. В 36 из 48 attention-слоёв используется Kimi Delta Attention, роутинг экспертов основан на подходе DeepSeek-V3, применяются оптимизатор Muon и Attention Residuals. Уникальной разработчики называют итоговую комбинацию блоков, их собственную реализацию и инженерные оптимизации. Для поддержки модели им пришлось написать отдельный архитектурный код и внести изменения в vLLM. ❓ Рассуждения заложили уже в претрейн. Последние 280 млрд токенов состояли из сложных математических решений, кода, поисковых сессий и взаимодействий с инструментами. Эта стадия подняла результат на AIME по pass@32 на 63,4 п. п., на HMMT — на 72,6 п. п., на Codeforces по pass@8 — на 45,6 п. п. После одинакового SFT преимущество сохранилось: +3,8 п. п. на HMMT и +6,6 п. п. на Codeforces. Помним, что нынешний релиз — экспериментальная основа для будущей единой рассуждающей модели. А вот будут ли выкладывать её, как какой-нибудь GigaChat 3.5 Reasoning, в компании пока не говорят. «Мы не опенсорсим ради опенсорса. Если в процессе работы над продакшен-моделями у нас появляются полезные для сообщества результаты, мы ими делимся», — говорят в Яндексе. ☁️ Компактность здесь скорее оружие, чем ограничение. У Alice активны 3 млрд параметров против 12 млрд у Nemotron-3-Super и 13 млрд у DeepSeek-V4-Flash. При этом на опубликованных замерах она обходит их на многих задачах по русскоязычным знаниям, математике и коду. По оценке собеседника в крупном облачном провайдере, модель можно разместить на двух Nvidia H100 с квантованием или четырёх H100 в BF16. Немного смутило окно контекста в 128 тысяч токенов. Разработчики говорят, что модель фактически умеет работать с контекстом до 256-262 тысяч токенов. 128 тысяч — отсечка, на которой сохраняется наилучшее качество. Факт релиза важен сам по себе. Одна модель означает технологическую монокультуру: ошибки в архитектуре, данных или цепочке разработки одного поставщика становятся проблемой всего рынка. В категории «суверенных» вновь (или по-прежнему) два игрока — и их конкуренция будет влиять уже не только на качество ответов, но и на стоимость внедрения, безопасность и скорость развития российских ИИ-агентов. @anti_agi