Q8 не победил.
Практичность — да.
Пять конфигураций Qwythos и Ornith: один общий стенд, единый набор из 42 задач, скорость, видеопамять, MTP и честная устойчивость на десяти повторах.
Модель — это веса.
Профиль — способ запуска.
Поэтому одна и та же Ornith встречается несколько раз. Меняются квант, контекст, шаблон диалога, ускорение и размещение весов между видеокартой и ЦПУ — а не обязательно сама модель.
ornith9b-q5kmOrnith 9B · Q5_K_M
Более лёгкий квант Q5_K_M: в этой серии дал то же качество, что Q8_0, но оказался быстрее и экономнее по видеопамяти.
ornith9b-q8Ornith 9B · Q8_0
Та же модель Ornith 9B с более точным, но более тяжёлым Q8_0. Нужна, чтобы проверить, окупается ли больший квант.
qwythos-q6Qwythos 9B · Q6_K с MTP
Q6_K с ускорением MTP: модель заранее предлагает короткую цепочку токенов и принимает удачные предположения.
qwythos-q8-mtpQwythos 9B · Q8_0 с MTP
Тяжёлый Q8_0 с MTP. Запас видеопамяти уменьшен специально, чтобы веса оставались на видеокарте и ускорение не срывалось.
qwythos-q8-nomtpQwythos 9B · Q8_0 без MTP
Отдельный Q8_0 GGUF без MTP-головы. Это базовая точка, по которой виден именно эффект ускорения MTP.
Побеждает не
самый тяжёлый квант.
Здесь итоговый балл одинаков у нескольких вариантов, поэтому решение дают устойчивость, скорость и память.
Ornith 9B · Q5_K_M
Второй результат на едином наборе при десяти повторах, 9/9 задач на длинный контекст и самый низкий расход памяти среди лидеров 9B.
Qwythos 9B · Q6_K с MTP
OpenCode 3/3, BFCL 94,25% и 7/9 по транскриптам. Единый набор заметно менее устойчив, чем у Ornith.
Та же точность, больше цена
Ornith Q8 сохранил 43/51, но потерял скорость и память. Qwythos Q8 без MTP также не улучшил результат одиночного прогона.
Результаты текстовой матрицы
Доля решённых задач; каждая полоса начинается от нуля. Номер получают только профили с полным и одинаковым знаменателем из 51 задачи.
Единый набор на десяти повторах
Каждый профиль: 42 одинаковые задачи × 10 начальных значений. Длинный контекст не входит в диапазон — он выполнялся только в первом повторе.
Цена Q8 и эффект MTP
Ни один вариант Q8 не дал убедительного выигрыша в качестве. Ниже — фактические метрики одиночного прогона настроенных профилей.
Q8 оставил те же 43/51, но стал на 25,6% медленнее и потребовал ещё 2,2 ГиБ видеопамяти.
Q8 с MTP вернул скорость относительно варианта без MTP, но потерял три задачи единого набора. Q6 сохранил и скорость, и качество одиночного прогона.
Что доказано, а что нет
Недействительный внешний прогон — не ноль модели. Поэтому BFCL не превращён в пустую таблицу лидеров.
Qwythos 9B · Q6_K с MTP
377 корректных вызовов из 400. Это единственный полный и валидный BFCL в серии.
181 секунд
Три реальные файловые задачи, тесты и обязательные изменения прошли.
Qwythos Q8 и Ornith 9B · Q5_K_M
Все расширенные попытки оборвались из-за инфраструктуры; частичные 6 из 400 генераций нельзя превращать в нулевой балл.
Результаты по наборам задач
Число в ячейке — решено/проверено. Более тёмный синий означает большую долю, но точное значение остаётся видимым.
| Конфигурация | Код | Логика | Инструменты | Инструкции | Русский | Длинный контекст |
|---|---|---|---|---|---|---|
| Ornith 9B · Q5_K_MQ5_K_M · 128K | 9/1275% | 8/8100% | 8/8100% | 7/888% | 2/633% | 9/9100% |
| Ornith 9B · Q8_0Q8_0 · 128K | 9/1275% | 8/8100% | 8/8100% | 8/8100% | 1/617% | 9/9100% |
| Qwythos 9B · Q6_K с MTPQ6_K · 128K | 9/1275% | 7/888% | 8/8100% | 6/875% | 4/667% | 9/9100% |
| Qwythos 9B · Q8_0 с MTPQ8_0 · 128K | 6/1250% | 7/888% | 8/8100% | 7/888% | 3/650% | 9/9100% |
| Qwythos 9B · Q8_0 без MTPQ8_0 · 128K | 9/1275% | 6/875% | 8/8100% | 7/888% | 4/667% | 9/9100% |
Проверка по глубине контекста
Три задачи на окно: финальное решение, список действий и исправление ошибок распознавания речи. Прочерк означает, что профиль на этой глубине не запускался.
Все профили страницы
Сортировка не отменяет статус сопоставимости. Проценты всегда идут рядом с числителем и знаменателем.
| Конфигурация | Матрица | Единый набор | 10 повторов | Скорость | Первый токен | Видеопамять | Агентские задачи |
|---|---|---|---|---|---|---|---|
| A Ornith 9B · Q5_K_MРекомендуемый профиль Ornith 9B · Q5_K_M · 128K · полный 51 | 84.3%43/51 | 81%34/42 | 845%34–37/42 | 107,2токен/с | 100мс | 10,5 ГиБ10 752 МиБ | —не гонялся |
| B Ornith 9B · Q8_0Контрольный тяжёлый квант · Q8_0 · 128K · полный 51 | 84.3%43/51 | 81%34/42 | —n=1 | 79,8токен/с | 106мс | 12,7 ГиБ13 005 МиБ | —не гонялся |
| A Qwythos 9B · Q6_K с MTPОсновной профиль Qwythos 9B · Q6_K · 128K · полный 51 | 84.3%43/51 | 81%34/42 | 76.19%29–35/42 | 120,4токен/с | 148мс | 12,9 ГиБ13 190 МиБ | 3/3181 с |
| B Qwythos 9B · Q8_0 без MTPКонтроль без MTP · Q8_0 · 128K · полный 51 | 84.3%43/51 | 81%34/42 | —n=1 | 76,2токен/с | 113мс | 12,7 ГиБ13 001 МиБ | —не гонялся |
| B Qwythos 9B · Q8_0 с MTPQ8 с ускорением MTP · Q8_0 · 128K · полный 51 | 78.4%40/51 | 73.8%31/42 | —n=1 | 119,2токен/с | 128мс | 14,2 ГиБ14 573 МиБ | —не гонялся |
Что можно сравнивать.
Сайт хранит версионированный снимок первичных результатов. Опубликованная сборка не читает локальные папки и не пересчитывает данные на лету.
Единый набор
42 задачи: 12 на код, по 8 на логику, инструменты и инструкции, 6 на русский. Только этот слой повторён десять раз для шести профилей.
Длинный контекст
До девяти синтетических задач выполнены один раз. Транскрипты отдельно проверяют 8/32/64K; заявленное окно не равно доказанному поиску на всём окне.
Наблюдаемая скорость
Медианы сервера показывают скорость настроенных профилей. Запросы иногда многосоставные; это не чистая аппаратная микропроверка.
Ответвление Bonsai
Отдельная среда PrismML под qwen35/Q2_0. Скорость реальна для этой установки, но не является чистым сравнением с основной веткой llama.cpp.
Gemma 48K/64K имеет знаменатель 48 вместо 51: три задачи на длинный контекст 64K автоматически пропущены.
Визуальные псевдонимы используют тот же текстовый GGUF с mmproj и набор всего из 4 задач; это не отдельные участники общего зачёта.
Штатный Ornith, froggeric и CpuMoe35 используют один GGUF и являются конфигурационным сравнением A/B, а не тремя моделями.
BFCL 94,25% действителен только для Qwythos Q6 и категории простых вызовов Python; расширенные повторы Q8 и Ornith недействительны из-за инфраструктуры.
Для Qwopus OpenCode используется корректный второй повтор 2/3 за 802,7 с; стартовый прогон и первый повтор исключены.
Быстрый прогон LIBRA на 10 задач и не начавшийся полный прогон не входят в рейтинг.
Первичные отчёты и результаты имеют приоритет над текстовыми сводками при расхождении.
Первичные источники и статус прогонов +
недействительныйbench/results/overnight-bfcl-expanded-20260723недействительный прогон BFCL
недействительныйbench/results/overnight-bfcl-expanded-20260724-retry1недействительный прогон BFCL
недействительныйbench/results/overnight-bfcl-expanded-20260724-retry2недействительный прогон BFCL
вспомогательныйllama-ternary/AGENTS.mdЗафиксированные замеры ёмкости и PPL; первичные отчёты остаются источником метрик рейтинга.
вспомогательныйbench/LUNA_CHECKLIST_20260721.mdДокументирует причины исключения старого прогона OpenCode и первого повтора Qwopus.