Результаты · сентябрь 2026
Результаты проверки
Мы сравнили текущее когнитивное ядро LOZA 0.7B с базовой Qwen3 0.6B на задачах русского языка, рассуждения, знаний и математики. Это промежуточный снимок конфигурации 709M, а не оценка будущей микро‑MoE‑модели и не заявление о готовности продукта.
14 задач · точность
4LOZA1ничья9Qwen
LOZA показывает лучший результат в русской грамматике и нескольких задачах на связи в тексте. В знаниях и математике чаще выше результат Qwen.
3 языковые выборки · bpb
3 из 3ниже bpb у LOZA
На выборках Википедии, новостей и прозы LOZA лучше предсказывает продолжение текста. Для этой метрики меньшее значение означает лучший результат.
Эти две группы нельзя складывать в общий счёт: у них разные метрики и смысл. Ниже приведены все значения без отбора только удачных результатов.
14 задач · точность ↑ больше – лучше
Задачное табло
| Задача | Что проверяет | LOZA | Qwen | Итог |
|---|---|---|---|---|
| RuBLiMP | грамматика русского языка | 95,6 | 89,3 | LOZA |
| PARus | причина и следствие | 58,0 | 51,0 | LOZA |
| RWSD | разрешение ссылок в тексте | 52,9 | 49,5 | LOZA |
| LCS | связное продолжение фраз | 29,4 | 28,7 | LOZA |
| BPS | скобочная структура | 49,2 | 49,2 | ничья |
| Belebele | понимание прочитанного | 28,6 | 29,4 | Qwen |
| RCB | логическое следствие | 33,2 | 35,4 | Qwen |
| ruWorldTree | школьные научные факты | 27,8 | 35,6 | Qwen |
| ruOpenBookQA | общие факты | 24,7 | 31,4 | Qwen |
| ruMMLU | знания по дисциплинам | 25,2 | 31,1 | Qwen |
| mathLogicQA | текстовая логика | 27,5 | 37,9 | Qwen |
| ruMultiAr | цепочки вычислений | 29,4 | 35,7 | Qwen |
| ruModAr | остатки в текстовой форме | 40,3 | 98,2 | Qwen |
| SimpleAr | простая арифметика | 37,6 | 82,9 | Qwen |
Точность, % · больше – лучше · без примеров в запросе · снимок 02.09.2026
Язык · bpb ↓ меньше – лучше
Преимущество в языке
| Выборка | Тип текста | LOZA | Qwen | Разница |
|---|---|---|---|---|
| Википедия | энциклопедический русский | 0,458 | 0,635 | ≈28% ниже |
| Новости | новостной русский | 0,482 | 0,632 | ≈24% ниже |
| Проза | художественная литература | 0,318 | 0,366 | ≈13% ниже |
Показатель bpb отражает, насколько уверенно модель предсказывает продолжение русского текста: чем он ниже, тем лучше. На этом снимке LOZA впереди на всех трёх типах текста.
Методология
Как мы измеряем
01
Точный объект
Промежуточный снимок LOZA 0.7B от 02.09.2026 сравнивается с Qwen3-0.6B-Base.
02
Одинаковый сценарий
Обе базовые модели проходят задачи в одинаковой конфигурации и без примеров в запросе.
03
Отделённые тексты
Языковое качество измеряется на одинаковых выборках, не использованных для обучения.
04
Раздельные метрики
Точность задач и bpb языка показаны отдельно; сильные и слабые стороны не сводятся в один рейтинг.