Gemma 4
Unsloth 48K
Лидер итогового зачёта: 43/48. Ещё и очень быстрая, но занимает почти всю 16-гигабайтную видеопамять.
Первый срез: 21 конфигурация, 7 наборов задач и два контролируемых прогона. Новая серия 21–26 июля с десятью повторами и тернарной Bonsai вынесена в отдельный подробный раздел.
Абсолютного чемпиона нет: контекст, задержка и запас видеопамяти меняют правильный выбор.
Лидер итогового зачёта: 43/48. Ещё и очень быстрая, но занимает почти всю 16-гигабайтную видеопамять.
Почти тот же балл по единому набору, 128K контекста и 79% принятых MTP-токенов. Медленнее Gemma, зато остаётся заметный запас видеопамяти.
84% при 111 токен/с и 10,7 ГиБ видеопамяти. Q8 не добавил качества, но стал медленнее и тяжелее — здесь Q5 выглядит рациональнее.
Правее — быстрее генерация. Выше — лучше результат по единому набору. Размер точки отражает видеопамять: идеальная зона находится справа сверху.
Фильтруй, сортируй и нажимай на строки, чтобы поставить две конфигурации рядом.
| Профиль | Итого | Скорость | Первый токен | Видеопамять | Повторяемость | |
|---|---|---|---|---|---|---|
| 01 Gemma 4 Unsloth 26B · 48K48K контекста | 89.6%43/48 | 139.8токен/с | 112мс | 15.2ГиБ | 96.1%2 смен / 51 | |
| 02 Ornith 35B · CpuMoe 35256K контекста | 88.2%45/51 | 39.8токен/с | 682мс | 10.5ГиБ | — | |
| 03 Qwopus Coder 35B · 128K128K контекста | 88.2%45/51 | 61.4токен/с | 574мс | 11.6ГиБ | 86.3%7 смен / 51 | |
| 04 Ornith 9B · Q5_K_M128K контекста | 84.3%43/51 | 111.4токен/с | 96мс | 10.7ГиБ | — | |
| 05 Ornith 9B · Q8_0128K контекста | 84.3%43/51 | 83.3токен/с | 96мс | 13.1ГиБ | — | |
| 06 Qwythos 9B · Q6_K с MTP128K контекста | 84.3%43/51 | 125.2токен/с | 150мс | 13.1ГиБ | 100%0 смен / 51 | |
| 07 Qwythos 9B · Q8_0 без MTP128K контекста | 84.3%43/51 | 79.0токен/с | 107мс | 13.3ГиБ | — | |
| 08 Gemma 4 Google 26B · 64K64K контекста | 83.3%40/48 | 108.4токен/с | 188мс | 14.8ГиБ | 94.1%3 смен / 51 | |
| 09 Ornith 35B · шаблон Froggeric256K контекста | 82.4%42/51 | 47.8токен/с | 585мс | 14.2ГиБ | 100%0 смен / 51 | |
| 10 Ornith 35B · CpuMoe 28256K контекста | 82.4%42/51 | 47.5токен/с | 597мс | 14.2ГиБ | 98%1 смен / 51 | |
| 11 Qwen AesSedai 35B · без MTP256K контекста | 82.4%42/51 | 41.3токен/с | 636мс | 13.3ГиБ | 84.3%8 смен / 51 | |
| 12 Gemma 4 Google 26B · 16K16K контекста | 82.2%37/45 | 162.9токен/с | 112мс | 15.4ГиБ | 98%1 смен / 51 | |
| 13 Qwopus Coder 35B · 32K32K контекста | 82.2%37/45 | 60.9токен/с | 518мс | 9.8ГиБ | 90.2%5 смен / 51 | |
| 14 Qwopus Coder 35B · 64K64K контекста | 81.3%39/48 | 62.6токен/с | 568мс | 10.4ГиБ | 88.2%6 смен / 51 | |
| 15 Qwythos 9B · Q8_0 с MTP128K контекста | 78.4%40/51 | 124.7токен/с | 118мс | 14.7ГиБ | — | |
| 16 Qwen AgentWorld 35B · Q5256K контекста | 72.5%37/51 | 41.7токен/с | 628мс | 13.5ГиБ | 86.3%7 смен / 51 |
Пять профилей с обработкой изображений прошли 4 из 4: распознавание текста объявления, таблицу, переключатели интерфейса и диаграмму. Это победа совместимости, но не доказательство равного визуального интеллекта — набор упёрся в потолок сложности.
На 16 общих профилях сравнили статусы одинаковых заданий между двумя прогонами. Обработка изображений была идеально стабильна; у моделей с рассуждением разброс заметно выше.
Сайт собран как расширяемый атлас: новые JSON-отчёты автоматически становятся новыми срезами после синхронизации данных.
Локальный llama.cpp, сборка b10064. Пиковая видеопамять и оперативная память сняты на уровне серверного процесса.
Контролируемый режим выравнивает параметры между профилями; длинный контекст выполнялся одним прогоном.
Максимум 55 задач, но изображения и недоступные размеры контекста корректно пропускались.
Русский проверяющий модуль первоначально требовал буквальный маркер ANSWER:; проверка инструментов была слишком строга к строковым аргументам; лимит 6144 токена обрывал модели с рассуждением. Эти эффекты сильнее били по AgentWorld и базовому Qwen 3.6.
Задание russian-004 провалили все 11 исходных текстовых профилей — вероятен дефект задания. Поэтому выводы по русскому считай направляющими, не финальными.
Эффективное начальное значение не записано в JSONL первой версии; сравнение показывает повторяемость прогона, а не чистый причинный эффект этого значения.
Иными словами, таблица надёжно показывает чувствительность результата, но не позволяет строго разделить влияние начального значения, недетерминизм видеокарты и изменения запускающего кода.