#visual compare#Flash-Next#RTX4080#DGX Spark#EVO-X3#16k
Flash-Next 视觉对比 16k:Spark vs AMD vs AMD+4080
固定提示 3 条(game/arch/space)、max_tokens 16k。平均 wall:Spark 247s、AMD 410s、AMD+4080 442s。模型已能装下时,4080 spill 不带来速度收益。
AIAI Tech Engine Lab
•独立测试台实测
SPONSORED / ADVERTISEMENT
예약된 광고 영역
一句话。 同一 Flash-Next、同一 3 条提示、seed=441、max_tokens=16000,在 Spark / EVO 仅 AMD / EVO AMD+4080 上跑。速度:Spark ≫ AMD ≈ AMD+4080。但肉眼看多数结果质量很差或跑偏——自动 hit_ratio/closed_html 只表示“源码里有关键词”,不等于场景对、游戏能玩。
包定义:视觉对比包 v1。冒烟:game-01 · arch-01 · space-02。三机 Playwright render_ok 均为 0/3。
Totals
| Spark | EVO AMD | EVO AMD+4080 | |
|---|---|---|---|
| mean wall | 247s | 410s | 442s |
| decode | ~37 tok/s | ~26.5 | ~25.3 |
| mean hit_ratio | 0.89 | 0.94 | 0.89 |
| closed_html | 3/3 | 3/3 | 3/3 |
| render_ok | 0/3 | 0/3 | 0/3 |
肉眼 · 质量边界
- 有的页面几乎空白——对应全机
render_ok0/3。 - game-*:提示要的是电影截图不是可玩关卡;输出无
keydown/WASD,只有镜头循环。“游戏不动”在该规格下是预期。 - space-02:要求机库内银机体+橙衣工程师+货箱+蓝机器人+门外行星。标题写 Hangar,网格却常像火箭/战斗机轮廓;字符串检查只数
spacecraft就过关。 - arch-01 相对不那么烂,但仍非建筑级效果图。
本轮有效结论是机器速度/容量,不是“Flash-Next 擅长 3D”。v2 需:可玩 vs 静帧拆分、负面约束(禁止火箭发射/空战)、默认视觉/人工打分。
AMD+4080 除了显存还有收益吗?
对本负载:基本没有速度收益。 Flash-Next ROCmFP4 已能在纯 AMD(-dev Vulkan0 -c 32768)上跑满;再 layer spill 到 4080(-sm layer -ts 56,8)会吃 PCIe/切层开销。实测 AMD 410s vs AMD+4080 442s(约慢 8%)。
- 值得开 spill: 权重/KV 塞不进 AMD,或必须加大
-c避免长 HTML 截断(此前 quality×cost 在 4096 截断后改 32k)。 - 不值得: 模型+上下文已能装下——纯 AMD 在 wall 与 checklist 上持平或更好。
- 质量: hit_ratio 纯 AMD 略优(arch-01 0.83 vs 0.67)。4080 不会让画面更“好看”。
Setup
| Spark | EVO AMD | EVO AMD+4080 | |
|---|---|---|---|
| serve | SGLang NVFP4 :30000 | llama.cpp Vulkan0 | llama.cpp Vulkan1,0 -ts 56,8 |
| weights | Flash-Next NVFP4 | ROCmFP4-FAST ple16 | 同 GGUF |
| params | temp 0.4 · thinking off · seed 441 · max_tokens 16000 | ||
按提示 wall
| prompt | Spark | AMD | AMD+4080 |
|---|---|---|---|
| game-01 | 284s · 36.5 t/s · 10.4k tok | 426s · 26.5 · 11.3k | 522s · 25.2 · 13.1k |
| arch-01 | 162s · 38.1 · 6.2k | 314s · 26.6 · 8.4k | 356s · 25.4 · 9.0k |
| space-02 | 294s · 38.0 · 11.2k | 490s · 26.4 · 12.9k | 448s · 25.3 · 11.3k |
结果 HTML
怎么读
- Spark 在 wall 与 tok/s 全胜(相对 Vulkan GGUF 约 1.6–1.8×)。
- 4080 spill = 容量。 能装下就用纯 AMD;大模型/长上下文再开 spill。
- render_ok=0 是 Playwright 门未过,不是“没有画面”。
- 完整 12×4 矩阵尚未跑——目前仅 Flash-Next 冒烟 3 条。
原始:results/visual-compare/t16k-{spark,evo-amd,evo4080}-flash/ · 2026-09-04。