Результаты · сентябрь 2026

Результаты проверки

Мы сравнили текущее когнитивное ядро LOZA 0.7B с базовой Qwen3 0.6B на задачах русского языка, рассуждения, знаний и математики. Это промежуточный снимок конфигурации 709M, а не оценка будущей микро‑MoE‑модели и не заявление о готовности продукта.

14 задач · точность

4LOZA1ничья9Qwen

LOZA показывает лучший результат в русской грамматике и нескольких задачах на связи в тексте. В знаниях и математике чаще выше результат Qwen.

3 языковые выборки · bpb

3 из 3ниже bpb у LOZA

На выборках Википедии, новостей и прозы LOZA лучше предсказывает продолжение текста. Для этой метрики меньшее значение означает лучший результат.

Эти две группы нельзя складывать в общий счёт: у них разные метрики и смысл. Ниже приведены все значения без отбора только удачных результатов.

14 задач · точность ↑ больше – лучше

Задачное табло

Сравнение точности LOZA и Qwen на 14 задачах
ЗадачаЧто проверяетLOZAQwenИтог
RuBLiMPграмматика русского языка95,689,3LOZA
PARusпричина и следствие58,051,0LOZA
RWSDразрешение ссылок в тексте52,949,5LOZA
LCSсвязное продолжение фраз29,428,7LOZA
BPSскобочная структура49,249,2ничья
Belebeleпонимание прочитанного28,629,4Qwen
RCBлогическое следствие33,235,4Qwen
ruWorldTreeшкольные научные факты27,835,6Qwen
ruOpenBookQAобщие факты24,731,4Qwen
ruMMLUзнания по дисциплинам25,231,1Qwen
mathLogicQAтекстовая логика27,537,9Qwen
ruMultiArцепочки вычислений29,435,7Qwen
ruModArостатки в текстовой форме40,398,2Qwen
SimpleArпростая арифметика37,682,9Qwen

Точность, % · больше – лучше · без примеров в запросе · снимок 02.09.2026

Язык · bpb ↓ меньше – лучше

Преимущество в языке

Сравнение bpb LOZA и Qwen на трёх языковых выборках
ВыборкаТип текстаLOZAQwenРазница
Википедияэнциклопедический русский0,4580,635≈28% ниже
Новостиновостной русский0,4820,632≈24% ниже
Прозахудожественная литература0,3180,366≈13% ниже

Показатель bpb отражает, насколько уверенно модель предсказывает продолжение русского текста: чем он ниже, тем лучше. На этом снимке LOZA впереди на всех трёх типах текста.

Методология

Как мы измеряем

01

Точный объект

Промежуточный снимок LOZA 0.7B от 02.09.2026 сравнивается с Qwen3-0.6B-Base.

02

Одинаковый сценарий

Обе базовые модели проходят задачи в одинаковой конфигурации и без примеров в запросе.

03

Отделённые тексты

Языковое качество измеряется на одинаковых выборках, не использованных для обучения.

04

Раздельные метрики

Точность задач и bpb языка показаны отдельно; сильные и слабые стороны не сводятся в один рейтинг.

Это внутренняя оценка Promezis, а не официальный прогон MERA. Она показывает динамику разработки, но не подтверждает готовность модели к производственной эксплуатации. Для независимого сравнения потребуется внешний прогон по зафиксированной методике и конфигурации.