Server 120: полный отчёт по моделям
Ryzen AI Max+ 395 / Radeon 8060S, gfx1151 · 96 GiB UMA · Ubuntu 24.04 · ROCm 7.2.x · отчёт подготовлен 04.09.2026
Production baseline: Qwen3.6-35B-A3B Q4_K_M. Экспериментальные модели тестировались изолированно; production endpoint не переключался на кандидатов.
Сводная матрица
| Модель / квант | Вес модели | Runtime / конфигурация | Скорость и память | Качество / решение |
|---|---|---|---|---|
| Qwen3.6-35B-A3B Q4_K_M PRODUCTION | 20,408,576,512 B (~20.4 GB) SHA: 671e47e0… | llama.cpp b10276 ROCm/HIP gfx1151; -ngl 999 -np 1 --jinja --reasoning off --flash-attn off --no-mmap; production 8080, ctx до 262K в acceptance. | ~45–54 tok/s в коротких тестах; сопоставимый baseline 58.83–59.54 tok/s на 6-task control. Ранее stress 956 запросов без ошибок; VRAM в старых замерах ~42 GiB. | BASELINE / accepted. Лучший общий баланс скорости, RU/EN, coding и устойчивости. Production сохранять. |
| Qwen3.8-Flash-Next UD-IQ4_XS MTP / ROCm | 3 shards; MTP sidecar Q8_0 4,137,429,088 B | EngramHalo strix-halo-qwen4exp, ctx 65K–262K, q8 KV, flash-attn, b/ub 8192/2048, MTP n-max=4 + ngram. | Без MTP / MTP decode: 32K 16.3 / 21.4 tok/s (+31%); prefill 300 / 284 tok/s. 49K: 13.29 tok/s, VRAM ~74 GB. 130K: 14.07 tok/s, 77.35 GB. 195–245K: 11.57→10.29 tok/s, ~84 GB. MTP acceptance на длинном probe 27.38%. | EXTENDED PARTIAL PASS. Marker 3/3 до 245K, soak 99/100, но coding 26/45; не production. Рабочий профиль n-max=4, fallback n-max=2. |
| Qwen3.8-27B UD-Q5_K_XL VULKAN | 20,876,938,144 B (~20.88 GB) SHA: 8601193d… | b19cbe9 Vulkan gfx1151, ctx 65K, q8 KV, flash-attn on, full offload, no-MTP control. | Load ~13.64–19 s; VRAM ~22.8 GB; decode 10.35–10.46 tok/s. Qwen3.6 control: 58.83–59.54 tok/s (~5.6× быстрее). | EXPERIMENTAL SPECIALIST. Повторный smoke 3/6 против Qwen3.6 4/6; coding/logic/uncertainty не прошли. Не заменяет baseline. |
| Qwen-AgentWorld-35B-A3B UD-Q4_K_M AGENT SPECIALIST | 22,134,529,280 B (~22.13 GB) SHA: e7a8eafd… | b19cbe9 Vulkan; ctx 65K, --jinja --flash-attn on -ctk q8_0 -ctv q8_0, port 8097 isolated. Важно: этот runtime принимает tool_choice строкой. | Load ~2.61 s; VRAM ~23.1 GB. 50-turn read loop 93.177 s (~1.86 s/ход). Real sandbox 24.647 s/12 ops; recovery 11.666 s; MCP/web 13.216 s. | AGENT SPECIALIST / SANDBOX PASS. Protocol, real read/grep/write/shell, recovery, repo-edit, 50-turn и security/rollback PASS. Не general replacement. |
| GLM-4.7-Flash Q4_K_M GENERAL CANDIDATE | 18,132,721,376 B (~18.13 GB) SHA: 90e82ea7… | b10276 ROCm gfx1151; ctx 16K, -ngl 999 -np 1 --jinja --flash-attn off --no-mmap. | Модель metadata ~29.94B; VRAM ~20.57 GB; RSS ~1.15 GB; soak avg ~4.54 s/request. Точный tok/s не фиксировался. | GREEN experimental/general candidate. RU business, arithmetic, JSON, coding, native tools, 5/5 arithmetic, 20/20 soak PASS. Сравнительный production gate ещё нужен. |
| Nemotron-3-Nano-Omni-30B-A3B Q4_K_M | 22,421,823,328 B (~22.42 GB) mmproj F16 1,587,540,224 B | b10276 ROCm; ctx 32K text / 16K vision, flash off, no-mmap. Omni fork commit 8a5bf2f для audio/video. | Load ~2.93 s text / 16.20 s vision; VRAM ~25.5–26.05 GB; short soak ~60 tok/s; context decode 67.1→42.8 tok/s на 1.7K→27.8K prompt. | REJECT general/production. Arithmetic 0/5 неверна. Vision PASS; audio smoke PASS; known-content video PASS, исходный MP4 quality inconclusive. |
| Muse Glimmer 30B Q4_K_M + mmproj | 16,756,683,904 B (~16.76 GB) + projector 1,400,328,928 B | b10658 ROCm gfx1151; ctx 16K, flash on, no-mmap; isolated 8098. | Text decode 12.6–12.9 tok/s; vision 5/5, 36.2–118.9 s/image, отдельный 1С smoke 194.4 s; точный peak VRAM не снят. | VISION/AGENT STAGING. Text/tool/JSON/arithmetic/20 soak PASS, vision технически PASS. Медленная; нужен OCR ground truth и 32K/49K. |
| Granite 4.2-8B Q4_K_M | 5,347,917,952 B (~5.35 GB) SHA: 16a9369d… | b10658 ROCm; ctx 8K, flash on, no-mmap, reasoning off, isolated 8099. | Decode 38.2–38.9 tok/s. Cold start 4.886 s до полного ответа; VRAM peak не зафиксирован. | FAST HELPER / ROUTER. RU/EN, JSON, coding, native tool, 5/5 repeat, 20/20 soak PASS; arithmetic completion упёрлась в лимит. Не замена Qwen. |
| LFM2.5-1.2B Instruct Q4_K_M | ~1.2B; размер в cold-start отчёте не зафиксирован | b10276 ROCm; ctx 8K, flash off, no-mmap, reasoning off. | Start→ready 2.216 s; полный первый ответ 2.407 s; request 0.190 s. В отдельном 200 JSON тесте ~211–221 tok/s. | FAST ROUTER / JSON PREPROCESSOR. Ошибка в простом смысле «остатка товара»; только intent/extraction/strict JSON с verifier. |
| DeepSeek V4 Flash Vision Exp IQ2_XXS Q2 DEFERRED | 86,720,111,776 B (~80.8 GiB) + encoder 932,857,760 B (~890 MiB) | DS4 ROCm/gfx1151; ctx 16K/32K/49K; отдельный encoder. llama.cpp mmproj path не принят. | 20-image batch avg 97.608 s, median 97.683 s; 16K/32K/49K totals 214.903/564.467/769.298 s. | VISION RESEARCH/STAGING. Слишком медленная и encoder не совместим со stock llama.cpp; проект отложен по решению пользователя. |
Подробные конфигурации и выявленные настройки
Production
Production Qwen3.6 должен работать отдельно на loopback 8080 с --reasoning off --flash-attn off --no-mmap. Во время экспериментов модель не переключалась на кандидатов.
AgentWorld
Для b19cbe9 использовать tool_choice: "required". Object-форма даёт warning type must be string и fallback. Нужны top-level enable_thinking:false и корректная OpenAI history.
Ресурсный профиль
Тяжёлые модели запускались последовательно, -ngl 999, одна slot/parallel=1. Пиковая VRAM измерялась не для всех моделей; «available UMA» нельзя смешивать с peak VRAM.
Рекомендации по ролям
| Роль | Рекомендуемая модель | Почему | Ограничение |
|---|---|---|---|
| Общий production text/agent | Qwen3.6-35B-A3B Q4_K_M | Наиболее быстрый подтверждённый общий профиль, стабильный stress. | Следить за reasoning/flash/no-mmap настройками и долгим soak. |
| Изолированный tool/repo агент | Qwen-AgentWorld Q4_K_M Vulkan | 50/50 tool-loop, реальный sandbox, recovery, rollback. | Только sandbox specialist; внешний backend quality не проверен. |
| Быстрый helper/router | Granite 4.2-8B; LFM2.5 для preprocessor | 38–39 tok/s Granite; LFM cold-start 2.407 s и 211–221 tok/s JSON. | LFM нельзя доверять коротким business answers; оба требуют verifier. |
| Vision staging | Nemotron Omni stock или Muse | Nemotron JPEG PASS, Muse 5/5 vision. | Нужны корпоративный OCR batch, русские документы, audio/video quality. |
| Research long-context | Qwen3.8 Flash-Next MTP | Работает до 245K marker, MTP быстрее на коротком decode. | 10.29 tok/s на 245K, coding 26/45; production запрещён. |
Исторический каталог: модели, тестировавшиеся или установленные ранее
Эти позиции не являются «только текущими» тестами. Числа ниже взяты из прежних acceptance, smoke и installation records Server 120. Для старых прогонов runtime и параметры могли отличаться; переносить их напрямую на сегодняшнюю конфигурацию нельзя.
| Модель | Квант / вес | Исторический результат | Статус |
|---|---|---|---|
| Qwen3.6-35B-A3B UD-Q2_K_XL | Q2; 12,574,128,416 B | MTP n=1: +20.6% к Q2 и +40.2% к Q4 на long decode; 39/42 quality без MTP/MTP n=1; 100 sequential PASS. | FAST-MTP experimental; production не заменяет. |
| Qwen3.6-27B Q4_K_M | ~19.10 GB | 10/10 OLLAMATEST/smoke; ~10.0–11.15 tok/s. | Slow dense specialist. |
| Qwen3-30B-A3B-Instruct-2507 Q4_K_M | ~30B Q4 | ~54–56 tok/s short, ~8.5 tok/s long-context; slash-loop не обнаружен. | Historical fast candidate. |
| Qwen3-Coder-Next Q4_K_M | Q4_K_M | ~46.96 tok/s, ~46 GiB HIP, slash-loop не обнаружен. | Coding candidate; полный agent gate не закрыт. |
| Qwen2.5-0.5B Instruct Q4_K_M | 469 MiB | ~191.6–278 tok/s; 0/200 serial correctness. | REJECT work; permanent smoke only. |
| Gemma 4 12B IT QAT Q4_0 + mmproj | ~6.5 GB + ~168 MiB | ~25.5–28.18 tok/s; text 10/10; vision 3/3. | Vision specialist. |
| Gemma 4 31B Q4_0 + mmproj | ~17 GB + ~1.2 GB | ~10.6–11.51 tok/s; image recognition PASS. | Manual high-quality vision, slow. |
| MiniCPM5-1B Q4_K_M | ~1B Q4 | Исторически 0/200 strict; targeted smoke-plus: exact JSON/calculator/20 repeat PASS, ~216.7 tok/s. | Smoke-plus specialist. |
| DeepSeek-R1-Distill-32B Q4_K_M | ~32B Q4 | ~9.1–10.1 tok/s short; long reasoning ~2.5 tok/s. | REJECT interactive. |
| DeepSeek-V4-Flash IQ2XXS-0731 | ~70 GiB planned memory | DS4 text/tool/OpenCode PASS; decode ~5–12 tok/s; ctx ≥16K required for OpenCode. | Research/staging. |
| GPT-OSS-120B MXFP4 | ~60 GiB | Один совместимый benchmark ~50–51 tok/s и tool PASS; pinned runtime не загрузился за 8–10 min, ~65 GiB VRAM + ~29 GiB RAM. | Runtime-dependent experimental; не production. |
| Nemotron-3-Nano-Omni-30B-A3B MXFP4_MOE | MXFP4; ~30B | ~57.07 tok/s, ~23.3 GiB HIP, slash-loop не обнаружен. | Fast experimental; полного acceptance нет. |
| Qwen3.6-35B official MTP Q4_0 draft | draft 1,060,038,432 B + base Q4 | 2/5 cases; MTP acceptance 0/75; ~16.7 tok/s; stale long-context contamination. | REJECT. |
| Qwen3.8-27B UD-Q4_K_XL | Q4 | Strict 8/10 no-MTP, 7/10 MTP; ~10–12 tok/s; long-context early/stale answer. | REJECT до runtime fix. |
| Qwen3.8-27B UD-Q6_K_L | ~26.6–27 GiB | Strict 6/10; медленнее Q5, repetitions/tool issues. | REJECT. |
| Qwen3.8-27B ROCmFP4-FAST | FP4 | ~13.91 tok/s без MTP; повторения, unusable tool-call. | REJECT. |
| Qwen3.8-Flash-Next 125B-A6B UD-IQ4_XS | ~87.2 GB | Vulkan short tool smoke PASS, ~20–22 tok/s; 3.5–4× decode cliff после ~1K context, slash corruption. | RED / WAIT. |
| MiniMax-H3 | Video model + Turbo LoRA | ComfyUI/TheRock gfx1151: 608×352 baseline 4/4, Turbo 1.3–2.4×; 1344×768 memory blocked. | Video background specialist. |
| H3 / vision и прочие локальные профили | Разные | Тестировались отдельными video/vision контурами; результаты сохранены в historical logs, не смешаны с text tok/s. | Historical / не production. |
Установлено, но не считать протестированным
На диске или в очереди также фигурировали Qwen3-8B/14B/32B, Qwen2.5-Coder-32B, Qwen2.5-72B, Llama 3.3 70B, DeepSeek-R1-Distill-Llama-70B, LFM2.5-8B-A1B и Qwen3.8-2.4T-A95B. Для них в локальном реестре нет полноценного inference acceptance; metadata/repository review не равен тесту.
Что ещё не является закрытым
- 50-task coding/repo-edit acceptance Qwen3.8-27B против Qwen3.6.
- Полный P1 Nemotron Nano: 1000-request stress и quality verifier.
- P3 Omni: эталонная русская транскрипция, длинные audio/video и корпоративный image batch.
- GLM Q6/IQ4 и GLM-4.6V OCR — только после подтверждения ресурсов и отдельного сравнения.
- Полный thermal/24h soak и точный peak VRAM для всех моделей.
Источники локальных измерений
Основные записи: MODEL_TEST_RESULT_QWEN38_FLASH_NEXT_P0_2026-09-03.md, MODEL_TEST_RESULT_QWEN38_Q5_VULKAN_P2_2026-09-03.md, MODEL_TEST_RESULT_QWEN_AGENTWORLD_P4_2026-09-03.md, MODEL_TEST_RESULT_NEMOTRON_OMNI_Q4_VISION_2026-09-03.md, MODEL_TEST_RESULTS_GRANITE_MUSE_2026-09-03.md, MODEL_TEST_RESULT_GLM_4_7_2026-09-03.md, MODEL_TEST_RESULT_LFM_COLD_START_2026-09-03.md, MODEL_TEST_RESULT_NEMOTRON_NANO_Q4_2026-09-03.md и TODO_SERVER120.md.