Server 120: полный отчёт по моделям

Ryzen AI Max+ 395 / Radeon 8060S, gfx1151 · 96 GiB UMA · Ubuntu 24.04 · ROCm 7.2.x · отчёт подготовлен 04.09.2026

Production baseline: Qwen3.6-35B-A3B Q4_K_M. Экспериментальные модели тестировались изолированно; production endpoint не переключался на кандидатов.

~45–60 tok/sQwen3.6 baseline, короткий decode
50/50AgentWorld tool-loop, 93.177 s
~84 GBпиковая наблюдаемая VRAM Flash-Next на 245K
0OOM/HIP crash на принятых изолированных прогонах

Сводная матрица

Модель / квантВес моделиRuntime / конфигурацияСкорость и памятьКачество / решение
Qwen3.6-35B-A3B Q4_K_M
PRODUCTION
20,408,576,512 B (~20.4 GB)
SHA: 671e47e0…
llama.cpp b10276 ROCm/HIP gfx1151; -ngl 999 -np 1 --jinja --reasoning off --flash-attn off --no-mmap; production 8080, ctx до 262K в acceptance.~45–54 tok/s в коротких тестах; сопоставимый baseline 58.83–59.54 tok/s на 6-task control. Ранее stress 956 запросов без ошибок; VRAM в старых замерах ~42 GiB.BASELINE / accepted. Лучший общий баланс скорости, RU/EN, coding и устойчивости. Production сохранять.
Qwen3.8-Flash-Next UD-IQ4_XS
MTP / ROCm
3 shards; MTP sidecar Q8_0 4,137,429,088 BEngramHalo strix-halo-qwen4exp, ctx 65K–262K, q8 KV, flash-attn, b/ub 8192/2048, MTP n-max=4 + ngram.Без MTP / MTP decode: 32K 16.3 / 21.4 tok/s (+31%); prefill 300 / 284 tok/s. 49K: 13.29 tok/s, VRAM ~74 GB. 130K: 14.07 tok/s, 77.35 GB. 195–245K: 11.57→10.29 tok/s, ~84 GB. MTP acceptance на длинном probe 27.38%.EXTENDED PARTIAL PASS. Marker 3/3 до 245K, soak 99/100, но coding 26/45; не production. Рабочий профиль n-max=4, fallback n-max=2.
Qwen3.8-27B UD-Q5_K_XL
VULKAN
20,876,938,144 B (~20.88 GB)
SHA: 8601193d…
b19cbe9 Vulkan gfx1151, ctx 65K, q8 KV, flash-attn on, full offload, no-MTP control.Load ~13.64–19 s; VRAM ~22.8 GB; decode 10.35–10.46 tok/s. Qwen3.6 control: 58.83–59.54 tok/s (~5.6× быстрее).EXPERIMENTAL SPECIALIST. Повторный smoke 3/6 против Qwen3.6 4/6; coding/logic/uncertainty не прошли. Не заменяет baseline.
Qwen-AgentWorld-35B-A3B UD-Q4_K_M
AGENT SPECIALIST
22,134,529,280 B (~22.13 GB)
SHA: e7a8eafd…
b19cbe9 Vulkan; ctx 65K, --jinja --flash-attn on -ctk q8_0 -ctv q8_0, port 8097 isolated. Важно: этот runtime принимает tool_choice строкой.Load ~2.61 s; VRAM ~23.1 GB. 50-turn read loop 93.177 s (~1.86 s/ход). Real sandbox 24.647 s/12 ops; recovery 11.666 s; MCP/web 13.216 s.AGENT SPECIALIST / SANDBOX PASS. Protocol, real read/grep/write/shell, recovery, repo-edit, 50-turn и security/rollback PASS. Не general replacement.
GLM-4.7-Flash Q4_K_M
GENERAL CANDIDATE
18,132,721,376 B (~18.13 GB)
SHA: 90e82ea7…
b10276 ROCm gfx1151; ctx 16K, -ngl 999 -np 1 --jinja --flash-attn off --no-mmap.Модель metadata ~29.94B; VRAM ~20.57 GB; RSS ~1.15 GB; soak avg ~4.54 s/request. Точный tok/s не фиксировался.GREEN experimental/general candidate. RU business, arithmetic, JSON, coding, native tools, 5/5 arithmetic, 20/20 soak PASS. Сравнительный production gate ещё нужен.
Nemotron-3-Nano-Omni-30B-A3B Q4_K_M22,421,823,328 B (~22.42 GB)
mmproj F16 1,587,540,224 B
b10276 ROCm; ctx 32K text / 16K vision, flash off, no-mmap. Omni fork commit 8a5bf2f для audio/video.Load ~2.93 s text / 16.20 s vision; VRAM ~25.5–26.05 GB; short soak ~60 tok/s; context decode 67.1→42.8 tok/s на 1.7K→27.8K prompt.REJECT general/production. Arithmetic 0/5 неверна. Vision PASS; audio smoke PASS; known-content video PASS, исходный MP4 quality inconclusive.
Muse Glimmer 30B Q4_K_M + mmproj16,756,683,904 B (~16.76 GB) + projector 1,400,328,928 Bb10658 ROCm gfx1151; ctx 16K, flash on, no-mmap; isolated 8098.Text decode 12.6–12.9 tok/s; vision 5/5, 36.2–118.9 s/image, отдельный 1С smoke 194.4 s; точный peak VRAM не снят.VISION/AGENT STAGING. Text/tool/JSON/arithmetic/20 soak PASS, vision технически PASS. Медленная; нужен OCR ground truth и 32K/49K.
Granite 4.2-8B Q4_K_M5,347,917,952 B (~5.35 GB)
SHA: 16a9369d…
b10658 ROCm; ctx 8K, flash on, no-mmap, reasoning off, isolated 8099.Decode 38.2–38.9 tok/s. Cold start 4.886 s до полного ответа; VRAM peak не зафиксирован.FAST HELPER / ROUTER. RU/EN, JSON, coding, native tool, 5/5 repeat, 20/20 soak PASS; arithmetic completion упёрлась в лимит. Не замена Qwen.
LFM2.5-1.2B Instruct Q4_K_M~1.2B; размер в cold-start отчёте не зафиксированb10276 ROCm; ctx 8K, flash off, no-mmap, reasoning off.Start→ready 2.216 s; полный первый ответ 2.407 s; request 0.190 s. В отдельном 200 JSON тесте ~211–221 tok/s.FAST ROUTER / JSON PREPROCESSOR. Ошибка в простом смысле «остатка товара»; только intent/extraction/strict JSON с verifier.
DeepSeek V4 Flash Vision Exp IQ2_XXS Q2
DEFERRED
86,720,111,776 B (~80.8 GiB) + encoder 932,857,760 B (~890 MiB)DS4 ROCm/gfx1151; ctx 16K/32K/49K; отдельный encoder. llama.cpp mmproj path не принят.20-image batch avg 97.608 s, median 97.683 s; 16K/32K/49K totals 214.903/564.467/769.298 s.VISION RESEARCH/STAGING. Слишком медленная и encoder не совместим со stock llama.cpp; проект отложен по решению пользователя.

Подробные конфигурации и выявленные настройки

Production

Production Qwen3.6 должен работать отдельно на loopback 8080 с --reasoning off --flash-attn off --no-mmap. Во время экспериментов модель не переключалась на кандидатов.

AgentWorld

Для b19cbe9 использовать tool_choice: "required". Object-форма даёт warning type must be string и fallback. Нужны top-level enable_thinking:false и корректная OpenAI history.

Ресурсный профиль

Тяжёлые модели запускались последовательно, -ngl 999, одна slot/parallel=1. Пиковая VRAM измерялась не для всех моделей; «available UMA» нельзя смешивать с peak VRAM.

Рекомендации по ролям

РольРекомендуемая модельПочемуОграничение
Общий production text/agentQwen3.6-35B-A3B Q4_K_MНаиболее быстрый подтверждённый общий профиль, стабильный stress.Следить за reasoning/flash/no-mmap настройками и долгим soak.
Изолированный tool/repo агентQwen-AgentWorld Q4_K_M Vulkan50/50 tool-loop, реальный sandbox, recovery, rollback.Только sandbox specialist; внешний backend quality не проверен.
Быстрый helper/routerGranite 4.2-8B; LFM2.5 для preprocessor38–39 tok/s Granite; LFM cold-start 2.407 s и 211–221 tok/s JSON.LFM нельзя доверять коротким business answers; оба требуют verifier.
Vision stagingNemotron Omni stock или MuseNemotron JPEG PASS, Muse 5/5 vision.Нужны корпоративный OCR batch, русские документы, audio/video quality.
Research long-contextQwen3.8 Flash-Next MTPРаботает до 245K marker, MTP быстрее на коротком decode.10.29 tok/s на 245K, coding 26/45; production запрещён.

Исторический каталог: модели, тестировавшиеся или установленные ранее

Эти позиции не являются «только текущими» тестами. Числа ниже взяты из прежних acceptance, smoke и installation records Server 120. Для старых прогонов runtime и параметры могли отличаться; переносить их напрямую на сегодняшнюю конфигурацию нельзя.

МодельКвант / весИсторический результатСтатус
Qwen3.6-35B-A3B UD-Q2_K_XLQ2; 12,574,128,416 BMTP n=1: +20.6% к Q2 и +40.2% к Q4 на long decode; 39/42 quality без MTP/MTP n=1; 100 sequential PASS.FAST-MTP experimental; production не заменяет.
Qwen3.6-27B Q4_K_M~19.10 GB10/10 OLLAMATEST/smoke; ~10.0–11.15 tok/s.Slow dense specialist.
Qwen3-30B-A3B-Instruct-2507 Q4_K_M~30B Q4~54–56 tok/s short, ~8.5 tok/s long-context; slash-loop не обнаружен.Historical fast candidate.
Qwen3-Coder-Next Q4_K_MQ4_K_M~46.96 tok/s, ~46 GiB HIP, slash-loop не обнаружен.Coding candidate; полный agent gate не закрыт.
Qwen2.5-0.5B Instruct Q4_K_M469 MiB~191.6–278 tok/s; 0/200 serial correctness.REJECT work; permanent smoke only.
Gemma 4 12B IT QAT Q4_0 + mmproj~6.5 GB + ~168 MiB~25.5–28.18 tok/s; text 10/10; vision 3/3.Vision specialist.
Gemma 4 31B Q4_0 + mmproj~17 GB + ~1.2 GB~10.6–11.51 tok/s; image recognition PASS.Manual high-quality vision, slow.
MiniCPM5-1B Q4_K_M~1B Q4Исторически 0/200 strict; targeted smoke-plus: exact JSON/calculator/20 repeat PASS, ~216.7 tok/s.Smoke-plus specialist.
DeepSeek-R1-Distill-32B Q4_K_M~32B Q4~9.1–10.1 tok/s short; long reasoning ~2.5 tok/s.REJECT interactive.
DeepSeek-V4-Flash IQ2XXS-0731~70 GiB planned memoryDS4 text/tool/OpenCode PASS; decode ~5–12 tok/s; ctx ≥16K required for OpenCode.Research/staging.
GPT-OSS-120B MXFP4~60 GiBОдин совместимый benchmark ~50–51 tok/s и tool PASS; pinned runtime не загрузился за 8–10 min, ~65 GiB VRAM + ~29 GiB RAM.Runtime-dependent experimental; не production.
Nemotron-3-Nano-Omni-30B-A3B MXFP4_MOEMXFP4; ~30B~57.07 tok/s, ~23.3 GiB HIP, slash-loop не обнаружен.Fast experimental; полного acceptance нет.
Qwen3.6-35B official MTP Q4_0 draftdraft 1,060,038,432 B + base Q42/5 cases; MTP acceptance 0/75; ~16.7 tok/s; stale long-context contamination.REJECT.
Qwen3.8-27B UD-Q4_K_XLQ4Strict 8/10 no-MTP, 7/10 MTP; ~10–12 tok/s; long-context early/stale answer.REJECT до runtime fix.
Qwen3.8-27B UD-Q6_K_L~26.6–27 GiBStrict 6/10; медленнее Q5, repetitions/tool issues.REJECT.
Qwen3.8-27B ROCmFP4-FASTFP4~13.91 tok/s без MTP; повторения, unusable tool-call.REJECT.
Qwen3.8-Flash-Next 125B-A6B UD-IQ4_XS~87.2 GBVulkan short tool smoke PASS, ~20–22 tok/s; 3.5–4× decode cliff после ~1K context, slash corruption.RED / WAIT.
MiniMax-H3Video model + Turbo LoRAComfyUI/TheRock gfx1151: 608×352 baseline 4/4, Turbo 1.3–2.4×; 1344×768 memory blocked.Video background specialist.
H3 / vision и прочие локальные профилиРазныеТестировались отдельными video/vision контурами; результаты сохранены в historical logs, не смешаны с text tok/s.Historical / не production.

Установлено, но не считать протестированным

На диске или в очереди также фигурировали Qwen3-8B/14B/32B, Qwen2.5-Coder-32B, Qwen2.5-72B, Llama 3.3 70B, DeepSeek-R1-Distill-Llama-70B, LFM2.5-8B-A1B и Qwen3.8-2.4T-A95B. Для них в локальном реестре нет полноценного inference acceptance; metadata/repository review не равен тесту.

Что ещё не является закрытым

Источники локальных измерений

Основные записи: MODEL_TEST_RESULT_QWEN38_FLASH_NEXT_P0_2026-09-03.md, MODEL_TEST_RESULT_QWEN38_Q5_VULKAN_P2_2026-09-03.md, MODEL_TEST_RESULT_QWEN_AGENTWORLD_P4_2026-09-03.md, MODEL_TEST_RESULT_NEMOTRON_OMNI_Q4_VISION_2026-09-03.md, MODEL_TEST_RESULTS_GRANITE_MUSE_2026-09-03.md, MODEL_TEST_RESULT_GLM_4_7_2026-09-03.md, MODEL_TEST_RESULT_LFM_COLD_START_2026-09-03.md, MODEL_TEST_RESULT_NEMOTRON_NANO_Q4_2026-09-03.md и TODO_SERVER120.md.