Общий зачёт.
Без фальшивого №1.
14 текстовых конфигураций, шесть профилей с проверкой на десяти повторах и отдельный протокол Bonsai с увеличенным бюджетом рассуждений. Рейтинг разделяет строгие, сокращённые и условные результаты.
Модель — это веса.
Профиль — способ запуска.
Поэтому одна и та же Ornith встречается несколько раз. Меняются квант, контекст, шаблон диалога, ускорение и размещение весов между видеокартой и ЦПУ — а не обязательно сама модель.
ornith9b-q5kmOrnith 9B · Q5_K_M
Более лёгкий квант Q5_K_M: в этой серии дал то же качество, что Q8_0, но оказался быстрее и экономнее по видеопамяти.
ornith9b-q8Ornith 9B · Q8_0
Та же модель Ornith 9B с более точным, но более тяжёлым Q8_0. Нужна, чтобы проверить, окупается ли больший квант.
qwythos-q6Qwythos 9B · Q6_K с MTP
Q6_K с ускорением MTP: модель заранее предлагает короткую цепочку токенов и принимает удачные предположения.
qwythos-q8-mtpQwythos 9B · Q8_0 с MTP
Тяжёлый Q8_0 с MTP. Запас видеопамяти уменьшен специально, чтобы веса оставались на видеокарте и ускорение не срывалось.
qwythos-q8-nomtpQwythos 9B · Q8_0 без MTP
Отдельный Q8_0 GGUF без MTP-головы. Это базовая точка, по которой виден именно эффект ускорения MTP.
ornith-q5kmOrnith 35B · CpuMoe 28
Основная настройка для 16 ГБ: 28 наборов экспертных весов MoE оставлены в оперативной памяти, остальное — на видеокарте.
ornith-moe35Ornith 35B · CpuMoe 35
Та же модель и тот же шаблон, но семь дополнительных наборов экспертных весов перенесены на ЦПУ. Видеопамяти свободнее, генерация медленнее.
ornith-froggericOrnith 35B · шаблон Froggeric
Не третья степень выгрузки: здесь остаётся CpuMoe 28. Меняется только шаблон диалога Froggeric.
gemma4-unsloth-48kGemma 4 Unsloth 26B · 48K
Альтернативный квант Unsloth UD-IQ4_XS. Экспертные веса не вынесены на ЦПУ, поэтому профиль быстрый, но окно ограничено 48K.
gemma4-google-64k-cpumoeGemma 4 Google 26B · 64K
QAT q4_0 от Google с четырьмя MoE-слоями на ЦПУ, чтобы разместить контекст 64K в 16 ГБ видеопамяти.
qwopus-128k-yarn4Qwopus Coder 35B · 128K
Qwopus Coder с MTP и расширением исходного окна 32K до 128K через YaRN ×4.
qwen36-aessedai-q5kmQwen AesSedai 35B · без MTP
AesSedai в Q5_K_M без MTP. Служит обычной точкой сравнения для 35B MoE-моделей на длинном контексте.
agentworld-q5kmQwen AgentWorld 35B · Q5
Qwen-AgentWorld 35B в UD-Q5_K_M. Отдельная модель, ориентированная на агентные сценарии, а не режим запуска AesSedai.
bonsai-27b-q2Bonsai 27B · тернарная
Тернарная Bonsai запускается не в основной сборке llama.cpp, а в отдельной среде PrismML. Результат с большим бюджетом ответа условно сопоставим.
28 — быстрее.
35 — свободнее.
CpuMoe — не число целиком выгруженных блоков. Параметр оставляет экспертные веса MoE первых N слоёв в оперативной памяти. При значении 35 на ЦПУ находятся экспертные веса ещё семи слоёв по сравнению с 28.
ornith-q5kmOrnith 35B · CpuMoe 28
Основная настройка для 16 ГБ: 28 наборов экспертных весов MoE оставлены в оперативной памяти, остальное — на видеокарте.
- Генерация
- 43,19 токена/с
- Обработка входа
- 613,90 токена/с
- Первый токен
- 602 мс
- Видеопамять
- 13,7 ГиБ
- Оперативная память
- 24,5 ГиБ
- Загрузка модели
- 17,6 с
- Единый набор, один прогон
- 33/42
ornith-moe35Ornith 35B · CpuMoe 35
Та же модель и тот же шаблон, но семь дополнительных наборов экспертных весов перенесены на ЦПУ. Видеопамяти свободнее, генерация медленнее.
- Генерация
- 36,23 токена/с
- Обработка входа
- 524,18 токена/с
- Первый токен
- 695 мс
- Видеопамять
- 10,0 ГиБ
- Оперативная память
- 28,3 ГиБ
- Загрузка модели
- 11,6 с
- Единый набор, один прогон
- 36/42
Ornith 35B · шаблон Froggeric: CpuMoe 28; меняется только формат диалога.
Обе Ornith 9B: CpuMoe 0; это сравнение квантов Q5_K_M и Q8_0, а не выгрузки.
Один пьедестал
здесь был бы ложью.
Практический выбор опирается на повторяемый единый набор, а матрица одиночного прогона остаётся картой возможностей и длинного контекста.
Ornith 9B · Q5_K_M
Верхняя группа на едином наборе при десяти повторах, 9/9 задач на длинный контекст, 6/6 по транскриптам до 32K и 107 токен/с при 10,5 ГиБ видеопамяти.
Gemma 4 Unsloth 26B · 48K
Лидер по устойчивости единого набора и скорости. Результат 43/48 честно живёт в отдельной лиге: три задачи на 64K были пропущены.
Bonsai 27B · тернарная
Штатно 29/51; с увеличенным бюджетом рассуждений 42/51. Второй результат нельзя превращать в обычное место без перегона всего парка.
Результаты текстовой матрицы
Доля решённых задач; каждая полоса начинается от нуля. Номер получают только профили с полным и одинаковым знаменателем из 51 задачи.
Качество и скорость генерации
Одна точка — одна конфигурация. Размер показывает пиковую видеопамять; контурный маркер означает результат с иной сопоставимостью.
- Qwen AgentWorld 35B · Q5: балл матрицы 72.5%, генерация 38,2 токен/с, пиковая видеопамять 13,0 ГиБ, статус — полный 51.
- Bonsai 27B · тернарная: балл матрицы 82.3%, генерация 67,6 токен/с, пиковая видеопамять 14,4 ГиБ, статус — особый протокол.
- Gemma 4 Google 26B · 64K: балл матрицы 83.3%, генерация 102,4 токен/с, пиковая видеопамять 15,0 ГиБ, статус — сокращённый.
- Gemma 4 Unsloth 26B · 48K: балл матрицы 89.6%, генерация 120,6 токен/с, пиковая видеопамять 15,4 ГиБ, статус — сокращённый.
- Ornith 35B · шаблон Froggeric: балл матрицы 82.3%, генерация 42,9 токен/с, пиковая видеопамять 13,7 ГиБ, статус — полный 51.
- Ornith 35B · CpuMoe 35: балл матрицы 88.2%, генерация 36,2 токен/с, пиковая видеопамять 10,0 ГиБ, статус — полный 51.
- Ornith 35B · CpuMoe 28: балл матрицы 82.3%, генерация 43,2 токен/с, пиковая видеопамять 13,7 ГиБ, статус — полный 51.
- Ornith 9B · Q5_K_M: балл матрицы 84.3%, генерация 107,2 токен/с, пиковая видеопамять 10,5 ГиБ, статус — полный 51.
- Ornith 9B · Q8_0: балл матрицы 84.3%, генерация 79,8 токен/с, пиковая видеопамять 12,7 ГиБ, статус — полный 51.
- Qwen AesSedai 35B · без MTP: балл матрицы 82.3%, генерация 38,1 токен/с, пиковая видеопамять 12,8 ГиБ, статус — полный 51.
- Qwopus Coder 35B · 128K: балл матрицы 88.2%, генерация 55,7 токен/с, пиковая видеопамять 11,1 ГиБ, статус — полный 51.
- Qwythos 9B · Q6_K с MTP: балл матрицы 84.3%, генерация 120,4 токен/с, пиковая видеопамять 12,9 ГиБ, статус — полный 51.
- Qwythos 9B · Q8_0 с MTP: балл матрицы 78.4%, генерация 119,2 токен/с, пиковая видеопамять 14,2 ГиБ, статус — полный 51.
- Qwythos 9B · Q8_0 без MTP: балл матрицы 84.3%, генерация 76,2 токен/с, пиковая видеопамять 12,7 ГиБ, статус — полный 51.
Единый набор на десяти повторах
Каждый профиль: 42 одинаковые задачи × 10 начальных значений. Длинный контекст не входит в диапазон — он выполнялся только в первом повторе.
Результаты по наборам задач
Число в ячейке — решено/проверено. Более тёмный синий означает большую долю, но точное значение остаётся видимым.
| Конфигурация | Код | Логика | Инструменты | Инструкции | Русский | Длинный контекст |
|---|---|---|---|---|---|---|
| Qwen AgentWorld 35B · Q5UD-Q5_K_M · 256K | 9/1275% | 8/8100% | 8/8100% | 6/875% | 0/60% | 6/967% |
| Bonsai 27B · тернарнаяQ2_0 · тернарная · 256K | 11/1292% | 8/8100% | 7/888% | 5/863% | 3/650% | 8/989% |
| Gemma 4 Google 26B · 64KQ4_0 QAT · 64K | 11/1292% | 8/8100% | 8/8100% | 6/875% | 1/617% | 6/6100% |
| Gemma 4 Unsloth 26B · 48KUD-IQ4_XS · 48K | 12/12100% | 8/8100% | 8/8100% | 6/875% | 3/650% | 6/6100% |
| Ornith 35B · шаблон FroggericQ5_K_M · 256K | 9/1275% | 8/8100% | 7/888% | 8/8100% | 1/617% | 9/9100% |
| Ornith 35B · CpuMoe 35Q5_K_M · 256K | 11/1292% | 8/8100% | 8/8100% | 8/8100% | 1/617% | 9/9100% |
| Ornith 35B · CpuMoe 28Q5_K_M · 256K | 9/1275% | 8/8100% | 7/888% | 8/8100% | 1/617% | 9/9100% |
| Ornith 9B · Q5_K_MQ5_K_M · 128K | 9/1275% | 8/8100% | 8/8100% | 7/888% | 2/633% | 9/9100% |
| Ornith 9B · Q8_0Q8_0 · 128K | 9/1275% | 8/8100% | 8/8100% | 8/8100% | 1/617% | 9/9100% |
| Qwen AesSedai 35B · без MTPQ5_K_M · 256K | 9/1275% | 8/8100% | 8/8100% | 7/888% | 1/617% | 9/9100% |
| Qwopus Coder 35B · 128KQ4_K_M · 128K | 11/1292% | 8/8100% | 7/888% | 6/875% | 5/683% | 8/989% |
| Qwythos 9B · Q6_K с MTPQ6_K · 128K | 9/1275% | 7/888% | 8/8100% | 6/875% | 4/667% | 9/9100% |
| Qwythos 9B · Q8_0 с MTPQ8_0 · 128K | 6/1250% | 7/888% | 8/8100% | 7/888% | 3/650% | 9/9100% |
| Qwythos 9B · Q8_0 без MTPQ8_0 · 128K | 9/1275% | 6/875% | 8/8100% | 7/888% | 4/667% | 9/9100% |
Проверка по глубине контекста
Три задачи на окно: финальное решение, список действий и исправление ошибок распознавания речи. Прочерк означает, что профиль на этой глубине не запускался.
Время до первого токена
Все профили получили 4/4, поэтому график показывает только задержку. Набор слишком прост и мал, чтобы ранжировать визуальный интеллект.
Все профили страницы
Сортировка не отменяет статус сопоставимости. Проценты всегда идут рядом с числителем и знаменателем.
| Конфигурация | Матрица | Единый набор | 10 повторов | Скорость | Первый токен | Видеопамять | Агентские задачи |
|---|---|---|---|---|---|---|---|
| A Gemma 4 Unsloth 26B · 48KСкоростной профиль Gemma · UD-IQ4_XS · 48K · сокращённый | 89.6%43/48 | 88.1%37/42 | 86.67%35–39/42 | 120,6токен/с | 125мс | 15,4 ГиБ15 768 МиБ | —не гонялся |
| B Ornith 35B · CpuMoe 35Профиль с запасом видеопамяти · Q5_K_M · 256K · полный 51 | 88.2%45/51 | 85.7%36/42 | —n=1 | 36,2токен/с | 695мс | 10,0 ГиБ10 241 МиБ | —не гонялся |
| A Qwopus Coder 35B · 128KКодовая модель с длинным окном · Q4_K_M · 128K · полный 51 | 88.2%45/51 | 88.1%37/42 | 83.57%32–37/42 | 55,7токен/с | 600мс | 11,1 ГиБ11 338 МиБ | 2/3803 с |
| A Ornith 9B · Q5_K_MРекомендуемый профиль Ornith 9B · Q5_K_M · 128K · полный 51 | 84.3%43/51 | 81%34/42 | 845%34–37/42 | 107,2токен/с | 100мс | 10,5 ГиБ10 752 МиБ | —не гонялся |
| B Ornith 9B · Q8_0Контрольный тяжёлый квант · Q8_0 · 128K · полный 51 | 84.3%43/51 | 81%34/42 | —n=1 | 79,8токен/с | 106мс | 12,7 ГиБ13 005 МиБ | —не гонялся |
| A Qwythos 9B · Q6_K с MTPОсновной профиль Qwythos 9B · Q6_K · 128K · полный 51 | 84.3%43/51 | 81%34/42 | 76.19%29–35/42 | 120,4токен/с | 148мс | 12,9 ГиБ13 190 МиБ | 3/3181 с |
| B Qwythos 9B · Q8_0 без MTPКонтроль без MTP · Q8_0 · 128K · полный 51 | 84.3%43/51 | 81%34/42 | —n=1 | 76,2токен/с | 113мс | 12,7 ГиБ13 001 МиБ | —не гонялся |
| B Gemma 4 Google 26B · 64KОфициальный квант Google · Q4_0 QAT · 64K · сокращённый | 83.3%40/48 | 81%34/42 | —n=1 | 102,4токен/с | 194мс | 15,0 ГиБ15 402 МиБ | —не гонялся |
| B Bonsai 27B · тернарнаяОсобый тернарный протокол · Q2_0 · тернарная · 256K · особый протокол | 82.3%42/51 | 81%34/42 | —n=1 | 67,6токен/с | 226мс | 14,4 ГиБ14 734 МиБ | 3/3194 с |
| B Ornith 35B · шаблон FroggericПроверка другого шаблона диалога · Q5_K_M · 256K · полный 51 | 82.3%42/51 | 78.6%33/42 | —n=1 | 42,9токен/с | 603мс | 13,7 ГиБ14 041 МиБ | —не гонялся |
| A Ornith 35B · CpuMoe 28Рабочий профиль Ornith 35B · Q5_K_M · 256K · полный 51 | 82.3%42/51 | 78.6%33/42 | 75.95%29–36/42 | 43,2токен/с | 602мс | 13,7 ГиБ14 041 МиБ | 3/3353 с |
| A Qwen AesSedai 35B · без MTPУниверсальный профиль Qwen 35B · Q5_K_M · 256K · полный 51 | 82.3%42/51 | 78.6%33/42 | 74.76%28–33/42 | 38,1токен/с | 657мс | 12,8 ГиБ13 115 МиБ | 3/3444 с |
| B Qwythos 9B · Q8_0 с MTPQ8 с ускорением MTP · Q8_0 · 128K · полный 51 | 78.4%40/51 | 73.8%31/42 | —n=1 | 119,2токен/с | 128мс | 14,2 ГиБ14 573 МиБ | —не гонялся |
| B Qwen AgentWorld 35B · Q5Специализированная AgentWorld · UD-Q5_K_M · 256K · полный 51 | 72.5%37/51 | 73.8%31/42 | —n=1 | 38,2токен/с | 644мс | 13,0 ГиБ13 313 МиБ | 3/31 029 с |
Что можно сравнивать.
Сайт хранит версионированный снимок первичных результатов. Опубликованная сборка не читает локальные папки и не пересчитывает данные на лету.
Единый набор
42 задачи: 12 на код, по 8 на логику, инструменты и инструкции, 6 на русский. Только этот слой повторён десять раз для шести профилей.
Длинный контекст
До девяти синтетических задач выполнены один раз. Транскрипты отдельно проверяют 8/32/64K; заявленное окно не равно доказанному поиску на всём окне.
Наблюдаемая скорость
Медианы сервера показывают скорость настроенных профилей. Запросы иногда многосоставные; это не чистая аппаратная микропроверка.
Ответвление Bonsai
Отдельная среда PrismML под qwen35/Q2_0. Скорость реальна для этой установки, но не является чистым сравнением с основной веткой llama.cpp.
Gemma 48K/64K имеет знаменатель 48 вместо 51: три задачи на длинный контекст 64K автоматически пропущены.
Визуальные псевдонимы используют тот же текстовый GGUF с mmproj и набор всего из 4 задач; это не отдельные участники общего зачёта.
Штатный Ornith, froggeric и CpuMoe35 используют один GGUF и являются конфигурационным сравнением A/B, а не тремя моделями.
BFCL 94,25% действителен только для Qwythos Q6 и категории простых вызовов Python; расширенные повторы Q8 и Ornith недействительны из-за инфраструктуры.
Для Qwopus OpenCode используется корректный второй повтор 2/3 за 802,7 с; стартовый прогон и первый повтор исключены.
Быстрый прогон LIBRA на 10 задач и не начавшийся полный прогон не входят в рейтинг.
Первичные отчёты и результаты имеют приоритет над текстовыми сводками при расхождении.
Первичные источники и статус прогонов +
недействительныйbench/results/overnight-bfcl-expanded-20260723недействительный прогон BFCL
недействительныйbench/results/overnight-bfcl-expanded-20260724-retry1недействительный прогон BFCL
недействительныйbench/results/overnight-bfcl-expanded-20260724-retry2недействительный прогон BFCL
вспомогательныйllama-ternary/AGENTS.mdЗафиксированные замеры ёмкости и PPL; первичные отчёты остаются источником метрик рейтинга.
вспомогательныйbench/LUNA_CHECKLIST_20260721.mdДокументирует причины исключения старого прогона OpenCode и первого повтора Qwopus.