λАТЛАС / ЛОКАЛЬНЫХ МОДЕЛЕЙАрхив ↗
Большие модели · 26–35B

Три лидера.
Три разных причины.

Gemma берёт устойчивость на едином наборе и скорость, Qwopus — полный профиль из 51 задачи, Bonsai — длинное окно и агентские возможности, но только при отдельном бюджете ответа.

9больших конфигураций
4профиля с 10 повторами
262Kпроверенное окно Bonsai
16 ГБлимит видеопамяти
00 / Модели и профили

Модель — это веса.
Профиль — способ запуска.

Поэтому одна и та же Ornith встречается несколько раз. Меняются квант, контекст, шаблон диалога, ускорение и размещение весов между видеокартой и ЦПУ — а не обязательно сама модель.

МодельКонкретный набор обученных весов: Ornith, Qwythos, Gemma, Bonsai.
ПрофильМодель плюс квант, контекст и все параметры запуска сервера.
Q5 / Q8Степень сжатия весов. Больше — обычно тяжелее и медленнее, но не всегда качественнее.
CpuMoe / MTPCpuMoe освобождает видеопамять; MTP пытается ускорить генерацию черновыми токенами.
Рабочий профиль Ornith 35Bornith-q5km

Ornith 35B · CpuMoe 28

Основная настройка для 16 ГБ: 28 наборов экспертных весов MoE оставлены в оперативной памяти, остальное — на видеокарте.

Как запускался256K · Q5_K_M · CpuMoe 28 · без MTP · штатный шаблон Ornith · кеш KV Q8_0
78.6%единый набор43,2токен/с13,7 ГиБвидеопамять
Профиль с запасом видеопамятиornith-moe35

Ornith 35B · CpuMoe 35

Та же модель и тот же шаблон, но семь дополнительных наборов экспертных весов перенесены на ЦПУ. Видеопамяти свободнее, генерация медленнее.

Как запускался256K · Q5_K_M · CpuMoe 35 · без MTP · штатный шаблон Ornith · кеш KV Q8_0
85.7%единый набор36,2токен/с10,0 ГиБвидеопамять
Проверка другого шаблона диалогаornith-froggeric

Ornith 35B · шаблон Froggeric

Не третья степень выгрузки: здесь остаётся CpuMoe 28. Меняется только шаблон диалога Froggeric.

Как запускался256K · Q5_K_M · CpuMoe 28 · без MTP · шаблон Froggeric · кеш KV Q8_0
78.6%единый набор42,9токен/с13,7 ГиБвидеопамять
Скоростной профиль Gemmagemma4-unsloth-48k

Gemma 4 Unsloth 26B · 48K

Альтернативный квант Unsloth UD-IQ4_XS. Экспертные веса не вынесены на ЦПУ, поэтому профиль быстрый, но окно ограничено 48K.

Как запускался48K · UD-IQ4_XS · полностью на видеокарте · CpuMoe 0 · без MTP · кеш KV Q8_0
88.1%единый набор120,6токен/с15,4 ГиБвидеопамять
Официальный квант Googlegemma4-google-64k-cpumoe

Gemma 4 Google 26B · 64K

QAT q4_0 от Google с четырьмя MoE-слоями на ЦПУ, чтобы разместить контекст 64K в 16 ГБ видеопамяти.

Как запускался64K · Q4_0 QAT · CpuMoe 4 · без MTP · кеш KV Q8_0
81%единый набор102,4токен/с15,0 ГиБвидеопамять
Кодовая модель с длинным окномqwopus-128k-yarn4

Qwopus Coder 35B · 128K

Qwopus Coder с MTP и расширением исходного окна 32K до 128K через YaRN ×4.

Как запускался128K · Q4_K_M · CpuMoe 31 · MTP: черновик до 3 токенов · YaRN ×4 · кеш KV Q8_0
88.1%единый набор55,7токен/с11,1 ГиБвидеопамять
Универсальный профиль Qwen 35Bqwen36-aessedai-q5km

Qwen AesSedai 35B · без MTP

AesSedai в Q5_K_M без MTP. Служит обычной точкой сравнения для 35B MoE-моделей на длинном контексте.

Как запускался256K · Q5_K_M · CpuMoe 31 · без MTP · кеш KV Q8_0
78.6%единый набор38,1токен/с12,8 ГиБвидеопамять
Специализированная AgentWorldagentworld-q5km

Qwen AgentWorld 35B · Q5

Qwen-AgentWorld 35B в UD-Q5_K_M. Отдельная модель, ориентированная на агентные сценарии, а не режим запуска AesSedai.

Как запускался256K · UD-Q5_K_M · CpuMoe 31 · без MTP · кеш KV Q8_0
73.8%единый набор38,2токен/с13,0 ГиБвидеопамять
Особый тернарный протоколbonsai-27b-q2

Bonsai 27B · тернарная

Тернарная Bonsai запускается не в основной сборке llama.cpp, а в отдельной среде PrismML. Результат с большим бюджетом ответа условно сопоставим.

Как запускался256K · Q2_0 · тернарная · среда PrismML · CpuMoe не применяется · без MTP · шаблон Qwen · кеш KV q4_0 · ответ минимум 32K
81%единый набор67,6токен/с14,4 ГиБвидеопамять
Разбор Ornith 35B

28 — быстрее.
35 — свободнее.

CpuMoe — не число целиком выгруженных блоков. Параметр оставляет экспертные веса MoE первых N слоёв в оперативной памяти. При значении 35 на ЦПУ находятся экспертные веса ещё семи слоёв по сравнению с 28.

Рекомендуется для текстаornith-q5km

Ornith 35B · CpuMoe 28

Основная настройка для 16 ГБ: 28 наборов экспертных весов MoE оставлены в оперативной памяти, остальное — на видеокарте.

Генерация
43,19 токена/с
Обработка входа
613,90 токена/с
Первый токен
602 мс
Видеопамять
13,7 ГиБ
Оперативная память
24,5 ГиБ
Загрузка модели
17,6 с
Единый набор, один прогон
33/42
Максимальный запас памятиornith-moe35

Ornith 35B · CpuMoe 35

Та же модель и тот же шаблон, но семь дополнительных наборов экспертных весов перенесены на ЦПУ. Видеопамяти свободнее, генерация медленнее.

Генерация
36,23 токена/с
Обработка входа
524,18 токена/с
Первый токен
695 мс
Видеопамять
10,0 ГиБ
Оперативная память
28,3 ГиБ
Загрузка модели
11,6 с
Единый набор, один прогон
36/42
−3,7 ГиБвидеопамять+3,7 ГиБоперативная память−16.1%скорость генерации+93 мсдо первого токена

Ornith 35B · шаблон Froggeric: CpuMoe 28; меняется только формат диалога.

Обе Ornith 9B: CpuMoe 0; это сравнение квантов Q5_K_M и Q8_0, а не выгрузки.

01 / Практический вердикт

Качество, полнота
или возможности.

У больших моделей разные победители, потому что знаменатель, среда выполнения и бюджет ответа действительно меняют смысл результата.

AУстойчивый единый набор

Gemma 4 Unsloth 26B · 48K

Лучшее среднее на десяти повторах и самая высокая скорость класса. Но три задачи на 64K не запускались, а агентские задачи Pi дали 0/3.

86.7%10 повторов120,6токен/с43/48матрица
BПолный профиль

Qwopus Coder 35B · 128K

45/51, сильный русский и 128K. На десяти повторах входит в верхнюю группу, но генерация медленнее, а транскрипты — 3/9.

45/51полная матрица83.6%10 повторов55,7токен/с
CОсобый протокол

Bonsai 27B · тернарная

3/3 агентских задач, 7/9 по транскриптам и 262K в 16 ГБ. Но 42/51 получены с минимумом 32K токенов ответа и одним начальным значением.

29→42задач194 сOpenCode 3/3262Kконтекст
02 / Матрица одиночного прогона

Результаты текстовой матрицы

Доля решённых задач; каждая полоса начинается от нуля. Номер получают только профили с полным и одинаковым знаменателем из 51 задачи.

—
Gemma 4 Unsloth 26B · 48KСкоростной профиль Gemma · UD-IQ4_XS · 48K · сокращённый
89.6%43/48
01
Ornith 35B · CpuMoe 35Профиль с запасом видеопамяти · Q5_K_M · 256K · полный 51
88.2%45/51
01
Qwopus Coder 35B · 128KКодовая модель с длинным окном · Q4_K_M · 128K · полный 51
88.2%45/51
—
Gemma 4 Google 26B · 64KОфициальный квант Google · Q4_0 QAT · 64K · сокращённый
83.3%40/48
—
Bonsai 27B · тернарнаяОсобый тернарный протокол · Q2_0 · тернарная · 256K · особый протокол
82.3%42/51
03
Ornith 35B · шаблон FroggericПроверка другого шаблона диалога · Q5_K_M · 256K · полный 51
82.3%42/51
03
Ornith 35B · CpuMoe 28Рабочий профиль Ornith 35B · Q5_K_M · 256K · полный 51
82.3%42/51
03
Qwen AesSedai 35B · без MTPУниверсальный профиль Qwen 35B · Q5_K_M · 256K · полный 51
82.3%42/51
06
Qwen AgentWorld 35B · Q5Специализированная AgentWorld · UD-Q5_K_M · 256K · полный 51
72.5%37/51
полный протокол из 51 задачи сокращённый знаменатель особый бюджет ответа Bonsai при штатном бюджете
03 / Карта компромиссов

Качество и скорость генерации

Одна точка — одна конфигурация. Размер показывает пиковую видеопамять; контурный маркер означает результат с иной сопоставимостью.

  • Qwen AgentWorld 35B · Q5: балл матрицы 72.5%, генерация 38,2 токен/с, пиковая видеопамять 13,0 ГиБ, статус — полный 51.
  • Bonsai 27B · тернарная: балл матрицы 82.3%, генерация 67,6 токен/с, пиковая видеопамять 14,4 ГиБ, статус — особый протокол.
  • Gemma 4 Google 26B · 64K: балл матрицы 83.3%, генерация 102,4 токен/с, пиковая видеопамять 15,0 ГиБ, статус — сокращённый.
  • Gemma 4 Unsloth 26B · 48K: балл матрицы 89.6%, генерация 120,6 токен/с, пиковая видеопамять 15,4 ГиБ, статус — сокращённый.
  • Ornith 35B · шаблон Froggeric: балл матрицы 82.3%, генерация 42,9 токен/с, пиковая видеопамять 13,7 ГиБ, статус — полный 51.
  • Ornith 35B · CpuMoe 35: балл матрицы 88.2%, генерация 36,2 токен/с, пиковая видеопамять 10,0 ГиБ, статус — полный 51.
  • Ornith 35B · CpuMoe 28: балл матрицы 82.3%, генерация 43,2 токен/с, пиковая видеопамять 13,7 ГиБ, статус — полный 51.
  • Qwen AesSedai 35B · без MTP: балл матрицы 82.3%, генерация 38,1 токен/с, пиковая видеопамять 12,8 ГиБ, статус — полный 51.
  • Qwopus Coder 35B · 128K: балл матрицы 88.2%, генерация 55,7 токен/с, пиковая видеопамять 11,1 ГиБ, статус — полный 51.
9B 26–35B сокращённый / условныйФокусные оси: 30–130 токен/с · 65%–95%
04 / Повторяемость

Единый набор на десяти повторах

Каждый профиль: 42 одинаковые задачи × 10 начальных значений. Длинный контекст не входит в диапазон — он выполнялся только в первом повторе.

60%70%80%90%95%
A
Gemma 4 Unsloth 26B · 48K6 нестабильных задач · ст. откл. 3,05 п.п.
86.67%35–39 / 42
A
Qwopus Coder 35B · 128K17 нестабильных задач · ст. откл. 4,19 п.п.
83.57%32–37 / 42
B
Ornith 35B · CpuMoe 2814 нестабильных задач · ст. откл. 5,05 п.п.
75.95%29–36 / 42
B
Qwen AesSedai 35B · без MTP17 нестабильных задач · ст. откл. 3,23 п.п.
74.76%28–33 / 42
06 / Агентская работа

OpenCode: три файловые задачи

Время суммарно по задачам «ranges», «ledger» и «config». Это одиночный прогон: результат показывает наличие возможности, а не доверительный интервал.

Bonsai 27B · тернарнаяOpenCode · 3/3 выполнено
194 с
Ornith 35B · CpuMoe 28OpenCode · 3/3 выполнено
353 с
Qwen AesSedai 35B · без MTPOpenCode · 3/3 выполнено
444 с
Qwopus Coder 35B · 128KOpenCode · 2/3 выполнено
803 с
Qwen AgentWorld 35B · Q5OpenCode · 3/3 выполнено
1 029 с
Специальный отчёт / ответвление PrismML

Bonsai 27B · тернарная

Тернарные веса Q2_0, контекст 262K и режим рассуждений. Один профиль — два протокола измерения, которые нельзя молча склеить.

≈1,71 бит / вес
Общий протокол · ответ 1–8K
29/5156.9%

21 обрыв по длине. Этот результат сопоставим по бюджету, но в основном измеряет незавершённое рассуждение.

С учётом рассуждений · минимум 32K ответа
42/5182.3%

6 обрывов осталось. Это профиль возможностей, но не напрямую сопоставимое место среди Luna.

+13решённых задач
+25,5 п.п.к баллу матрицы
2,49×токены ответа
3,09×время запросов
Код6→11 / 12
Логика5→8 / 8
Инструменты7→7 / 8
Инструкции3→5 / 8
Русский1→3 / 6
Длинный контекст7→8 / 9
Рабочие пределы

Скорость падает с глубиной, окно остаётся в 16 ГБ.

llama-bench — отдельная строгая проверка пропускной способности. Для остальных моделей показаны наблюдаемые медианы скорости настроенного серверного профиля.

пустой KV73,7 токен/с · генерация1 881 токен/с · pp512короткий запрос
глубина 8K60,7 токен/с · генерация1 750 токен/с · pp512KV частично заполнен
глубина 32K37,4 токен/с · генерация1 261 токен/с · pp512глубокий контекст
Профили видеопамятипик / 15,9 ГиБ
Текст · q4 KV256K14 749 МиБ
Изображение · полный256K15 489 МиБ
Изображение · 172K172K13 902 МиБ
Кэш KV · WikiText-2 PPLте же тернарные веса
8Kf1610,0628основа
8Kq8_010,0642+0,014%
8Kq4_010,0874+0,244%
32Kf1612,7666основа
32Kq4_012,7785+0,093%

q4_0 даёт пренебрежимо малую PPL-дельту и освобождает место для полного 262K окна. Это не сравнение тернарных весов с FP16-моделью.

05 / Профиль ошибок

Результаты по наборам задач

Число в ячейке — решено/проверено. Более тёмный синий означает большую долю, но точное значение остаётся видимым.

КонфигурацияКодЛогикаИнструментыИнструкцииРусскийДлинный контекст
Qwen AgentWorld 35B · Q5UD-Q5_K_M · 256K9/1275%8/8100%8/8100%6/875%0/60%6/967%
Bonsai 27B · тернарнаяQ2_0 · тернарная · 256K11/1292%8/8100%7/888%5/863%3/650%8/989%
Gemma 4 Google 26B · 64KQ4_0 QAT · 64K11/1292%8/8100%8/8100%6/875%1/617%6/6100%
Gemma 4 Unsloth 26B · 48KUD-IQ4_XS · 48K12/12100%8/8100%8/8100%6/875%3/650%6/6100%
Ornith 35B · шаблон FroggericQ5_K_M · 256K9/1275%8/8100%7/888%8/8100%1/617%9/9100%
Ornith 35B · CpuMoe 35Q5_K_M · 256K11/1292%8/8100%8/8100%8/8100%1/617%9/9100%
Ornith 35B · CpuMoe 28Q5_K_M · 256K9/1275%8/8100%7/888%8/8100%1/617%9/9100%
Qwen AesSedai 35B · без MTPQ5_K_M · 256K9/1275%8/8100%8/8100%7/888%1/617%9/9100%
Qwopus Coder 35B · 128KQ4_K_M · 128K11/1292%8/8100%7/888%6/875%5/683%8/989%
06 / Русские транскрипты

Проверка по глубине контекста

Три задачи на окно: финальное решение, список действий и исправление ошибок распознавания речи. Прочерк означает, что профиль на этой глубине не запускался.

Профиль8K32K64KИтого
Bonsai 27B · тернарнаябюджет ответа 32K3/32/32/37/978%
Gemma 4 Unsloth 26B · 48Kштатный бюджет2/31/3—3/650%
Qwopus Coder 35B · 128Kштатный бюджет0/31/32/33/933%
Gemma 4 Google 26B · 64Kштатный бюджет1/30/3—1/617%
Qwen AgentWorld 35B · Q5штатный бюджет0/30/3—0/60%
Ornith 35B · CpuMoe 28штатный бюджет0/30/3—0/60%
Qwen AesSedai 35B · без MTPштатный бюджет0/30/3—0/60%
07 / Быстрая проверка изображений

Время до первого токена

Все профили получили 4/4, поэтому график показывает только задержку. Набор слишком прост и мал, чтобы ранжировать визуальный интеллект.

Gemma 4 Unsloth 26B · изображения4/4 · 15,4 ГиБ
482 мс
Gemma 4 Google 26B · изображения4/4 · 15,2 ГиБ
510 мс
Bonsai 27B · изображения4/4 · 15,2 ГиБ
984 мс
Qwopus Coder 35B · изображения4/4 · 12,1 ГиБ
1 583 мс
Qwen AesSedai 35B · изображения4/4 · 13,7 ГиБ
1 760 мс
08 / Точные значения

Все профили страницы

Сортировка не отменяет статус сопоставимости. Проценты всегда идут рядом с числителем и знаменателем.

КонфигурацияМатрицаЕдиный набор10 повторовСкоростьПервый токенВидеопамятьАгентские задачи
A
Gemma 4 Unsloth 26B · 48KСкоростной профиль Gemma · UD-IQ4_XS · 48K · сокращённый
89.6%43/4888.1%37/4286.67%35–39/42120,6токен/с125мс15,4 ГиБ15 768 МиБ—не гонялся
B
Ornith 35B · CpuMoe 35Профиль с запасом видеопамяти · Q5_K_M · 256K · полный 51
88.2%45/5185.7%36/42—n=136,2токен/с695мс10,0 ГиБ10 241 МиБ—не гонялся
A
Qwopus Coder 35B · 128KКодовая модель с длинным окном · Q4_K_M · 128K · полный 51
88.2%45/5188.1%37/4283.57%32–37/4255,7токен/с600мс11,1 ГиБ11 338 МиБ2/3803 с
B
Gemma 4 Google 26B · 64KОфициальный квант Google · Q4_0 QAT · 64K · сокращённый
83.3%40/4881%34/42—n=1102,4токен/с194мс15,0 ГиБ15 402 МиБ—не гонялся
B
Bonsai 27B · тернарнаяОсобый тернарный протокол · Q2_0 · тернарная · 256K · особый протокол
82.3%42/5181%34/42—n=167,6токен/с226мс14,4 ГиБ14 734 МиБ3/3194 с
B
Ornith 35B · шаблон FroggericПроверка другого шаблона диалога · Q5_K_M · 256K · полный 51
82.3%42/5178.6%33/42—n=142,9токен/с603мс13,7 ГиБ14 041 МиБ—не гонялся
A
Ornith 35B · CpuMoe 28Рабочий профиль Ornith 35B · Q5_K_M · 256K · полный 51
82.3%42/5178.6%33/4275.95%29–36/4243,2токен/с602мс13,7 ГиБ14 041 МиБ3/3353 с
A
Qwen AesSedai 35B · без MTPУниверсальный профиль Qwen 35B · Q5_K_M · 256K · полный 51
82.3%42/5178.6%33/4274.76%28–33/4238,1токен/с657мс12,8 ГиБ13 115 МиБ3/3444 с
B
Qwen AgentWorld 35B · Q5Специализированная AgentWorld · UD-Q5_K_M · 256K · полный 51
72.5%37/5173.8%31/42—n=138,2токен/с644мс13,0 ГиБ13 313 МиБ3/31 029 с
09 / Методология и источники

Что можно сравнивать.

Сайт хранит версионированный снимок первичных результатов. Опубликованная сборка не читает локальные папки и не пересчитывает данные на лету.

01

Единый набор

42 задачи: 12 на код, по 8 на логику, инструменты и инструкции, 6 на русский. Только этот слой повторён десять раз для шести профилей.

02

Длинный контекст

До девяти синтетических задач выполнены один раз. Транскрипты отдельно проверяют 8/32/64K; заявленное окно не равно доказанному поиску на всём окне.

03

Наблюдаемая скорость

Медианы сервера показывают скорость настроенных профилей. Запросы иногда многосоставные; это не чистая аппаратная микропроверка.

04

Ответвление Bonsai

Отдельная среда PrismML под qwen35/Q2_0. Скорость реальна для этой установки, но не является чистым сравнением с основной веткой llama.cpp.

01

Gemma 48K/64K имеет знаменатель 48 вместо 51: три задачи на длинный контекст 64K автоматически пропущены.

02

Визуальные псевдонимы используют тот же текстовый GGUF с mmproj и набор всего из 4 задач; это не отдельные участники общего зачёта.

03

Штатный Ornith, froggeric и CpuMoe35 используют один GGUF и являются конфигурационным сравнением A/B, а не тремя моделями.

04

BFCL 94,25% действителен только для Qwythos Q6 и категории простых вызовов Python; расширенные повторы Q8 и Ornith недействительны из-за инфраструктуры.

05

Для Qwopus OpenCode используется корректный второй повтор 2/3 за 802,7 с; стартовый прогон и первый повтор исключены.

06

Быстрый прогон LIBRA на 10 задач и не начавшийся полный прогон не входят в рейтинг.

07

Первичные отчёты и результаты имеют приоритет над текстовыми сводками при расхождении.

Первичные источники и статус прогонов +

недействительныйbench/results/overnight-bfcl-expanded-20260723недействительный прогон BFCL

недействительныйbench/results/overnight-bfcl-expanded-20260724-retry1недействительный прогон BFCL

недействительныйbench/results/overnight-bfcl-expanded-20260724-retry2недействительный прогон BFCL

первичныйbench/results/bonsai-agent-opencode-20260726/bonsai-27b-q2-harness-opencode.jsonlжурнал агентских задач JSONL

первичныйbench/results/bonsai-hibudget-20260725первичная матрица JSONL

первичныйbench/reports/20260725-182159-bonsai-hibudget-20260725.jsonсводный отчёт матрицы

первичныйbench/results/bonsai-matrix-20260725/llama-bench-bonsai-27b-q2.jsonзамер llama-bench

вспомогательныйllama-ternary/AGENTS.mdЗафиксированные замеры ёмкости и PPL; первичные отчёты остаются источником метрик рейтинга.

первичныйbench/results/bonsai-matrix-20260725первичная матрица JSONL

первичныйbench/reports/20260725-160908-bonsai-matrix-20260725.jsonсводный отчёт матрицы

первичныйbench/results/bonsai-hibudget-transcript-20260726журнал транскриптов JSONL

первичныйbench/results/bonsai-transcript-20260725журнал транскриптов JSONL

первичныйbench/results/overnight-agent-gemma-pi-20260723/gemma4-unsloth-48k-harness-pi-host.jsonlКорректный модельный исход 0/3: прогон завершён, инфраструктурных ошибок среды нет.

первичныйbench/results/luna-agent-opencode-20260721-retry2/qwopus-128k-yarn4-harness-opencode.jsonlжурнал агентских задач JSONL

первичныйbench/results/luna-agent-opencode-20260721-retry1Четыре корректных профиля; первый повтор Qwopus исключён из-за дефекта фильтра снимков.

первичныйbench/results/luna-agent-pi-20260721журнал агентских задач JSONL

вспомогательныйbench/LUNA_CHECKLIST_20260721.mdДокументирует причины исключения старого прогона OpenCode и первого повтора Qwopus.

первичныйbench/results/luna-matrix-20260721первичная матрица JSONL

первичныйbench/reports/20260721-173740-luna-matrix-20260721.jsonСводка 13 текстовых и 5 визуальных профилей; проверяется по первичным JSONL.

первичныйbench/results/overnight-stability-10seed-20260723Единый набор: 42 задачи × 10 повторов; длинный контекст выполнен только в первом повторе и хранится отдельно.

первичныйbench/results/luna-transcript64-20260721журнал транскриптов JSONL

первичныйbench/results/luna-transcript-20260721журнал транскриптов JSONL

первичныйbench/profiles.jsonНазвания, семейства, контекст, MTP, класс размера и пути профилей запуска.

первичныйbench/results/luna-bfcl-20260721/external/qwythos-q6/bfclИспользуется категория простых вызовов Python, а не размытый общий результат по незапущенным категориям.