Собственная модель ИИ · русский язык в основе

ПРОМЕЗИС

Лаборатория Promezis с нуля обучает LOZA – русскоязычное когнитивное ядро будущей микро‑MoE‑модели. Мы исследуем, какого качества можно достичь полным собственным циклом при ограниченных вычислительных ресурсах.

01Текущее ядроLOZA 1.1 · 709M
02Языкрусский в основе данные · токенизация · оценка
03Подходполный цикл собственные данные и веса
04Этапбазовое обучение

Исследовательский подход

Русский язык как основа модели

ЯЗЫК

Русский – исходная основа

Корпус, токенизация и оценка качества строятся вокруг русского языка с первого этапа, а не добавляются после обучения.

КОНТРОЛЬ

Полный собственный цикл

Лаборатория самостоятельно готовит данные, начинает со случайных весов, ведёт обучение и оценивает каждую версию модели.

ЭФФЕКТИВНОСТЬ

Последовательное масштабирование

Когнитивное ядро прошло конфигурации 511M, 624M и 709M. Следующая архитектурная развилка – ещё одно расширение или переход к микро‑MoE.

Текущий этап

LOZA формирует когнитивное ядро

Текущая конфигурация 709M – не конечный продукт, а ядро будущей микро‑MoE‑модели общей ёмкостью 1,5–2,2 млрд параметров. Ядро последовательно выросло с 511M до 624M и 709M. После итоговой оценки мы выберем: расширить его ещё раз или перейти непосредственно к микро‑MoE.

Затем последуют работа с инструкциями, прикладная проверка и обучение отдельных закрытых моделей для конкретных предприятий.

Предложения от предприятий, разработчиков и исследовательских команд помогают формировать программу будущих проверок. Они не означают ранний доступ или обязательство по внедрению.

Когнитивное ядро
LOZA 1.1 · 709M
Рост
511M → 624M → 709M
Целевая архитектура
микро‑MoE · 1,5–2,2B
Следующее решение
расширение ядра или переход к микро‑MoE

Промежуточные результаты

Что показывает текущий этап

95,6

Русская грамматика

RuBLiMP: LOZA 95,6 против 89,3 у Qwen3-0.6B-Base.

≈28%

Точнее предсказывает русский текст

На выборке Википедии bpb ниже: 0,458 против 0,635. Для этой метрики меньше – лучше.

14 + 3

Раздельные группы проверок

Мы отдельно показываем 14 задач и три языковые выборки, включая слабые стороны модели.

Это промежуточный снимок, а не заявление о готовности продукта. Полная таблица, точный объект сравнения и ограничения опубликованы отдельно.

Направления применения

Возможные направления применения

ДОКУМЕНТЫ

Внутренние знания

Поиск, анализ и подготовка материалов на основе русскоязычных документов в закрытом контуре предприятия.

ОТРАСЛЬ

Профессиональный язык

Отдельное дообучение под терминологию, регламенты и материалы конкретной предметной области.

ПРОДУКТ

Специализированные решения

Будущая модель будет отдельно обучаться и поставляться конкретному предприятию как основа локального помощника или внутреннего сервиса.

Предложения

Принимаем
предложения

Предприятия, разработчики и исследовательские команды могут предложить предметный сценарий или набор критериев. Мы учитываем такие материалы при планировании будущих проверок и отдельных прикладных моделей.