AIAI Tech Engine
首页/基准/Flash-Next 视觉对比 16k:Spark vs AMD vs AMD+4080
#visual compare#Flash-Next#RTX4080#DGX Spark#EVO-X3#16k

Flash-Next 视觉对比 16k:Spark vs AMD vs AMD+4080

固定提示 3 条(game/arch/space)、max_tokens 16k。平均 wall:Spark 247s、AMD 410s、AMD+4080 442s。模型已能装下时,4080 spill 不带来速度收益。

AIAI Tech Engine Lab
独立测试台实测
SPONSORED / ADVERTISEMENT
예약된 광고 영역

一句话。 同一 Flash-Next、同一 3 条提示、seed=441、max_tokens=16000,在 Spark / EVO 仅 AMD / EVO AMD+4080 上跑。速度:Spark ≫ AMD ≈ AMD+4080。但肉眼看多数结果质量很差或跑偏——自动 hit_ratio/closed_html 只表示“源码里有关键词”,不等于场景对、游戏能玩。

包定义:视觉对比包 v1。冒烟:game-01 · arch-01 · space-02。三机 Playwright render_ok 均为 0/3。

Totals

SparkEVO AMDEVO AMD+4080
mean wall247s410s442s
decode~37 tok/s~26.5~25.3
mean hit_ratio0.890.940.89
closed_html3/33/33/3
render_ok0/30/30/3

肉眼 · 质量边界

  • 有的页面几乎空白——对应全机 render_ok 0/3。
  • game-*:提示要的是电影截图不是可玩关卡;输出无 keydown/WASD,只有镜头循环。“游戏不动”在该规格下是预期。
  • space-02:要求机库内银机体+橙衣工程师+货箱+蓝机器人+门外行星。标题写 Hangar,网格却常像火箭/战斗机轮廓;字符串检查只数 spacecraft 就过关。
  • arch-01 相对不那么烂,但仍非建筑级效果图。

本轮有效结论是机器速度/容量,不是“Flash-Next 擅长 3D”。v2 需:可玩 vs 静帧拆分、负面约束(禁止火箭发射/空战)、默认视觉/人工打分。

AMD+4080 除了显存还有收益吗?

对本负载:基本没有速度收益。 Flash-Next ROCmFP4 已能在纯 AMD(-dev Vulkan0 -c 32768)上跑满;再 layer spill 到 4080(-sm layer -ts 56,8)会吃 PCIe/切层开销。实测 AMD 410s vs AMD+4080 442s(约慢 8%)。

  • 值得开 spill: 权重/KV 塞不进 AMD,或必须加大 -c 避免长 HTML 截断(此前 quality×cost 在 4096 截断后改 32k)。
  • 不值得: 模型+上下文已能装下——纯 AMD 在 wall 与 checklist 上持平或更好。
  • 质量: hit_ratio 纯 AMD 略优(arch-01 0.83 vs 0.67)。4080 不会让画面更“好看”。

Setup

SparkEVO AMDEVO AMD+4080
serveSGLang NVFP4 :30000llama.cpp Vulkan0llama.cpp Vulkan1,0 -ts 56,8
weightsFlash-Next NVFP4ROCmFP4-FAST ple16同 GGUF
paramstemp 0.4 · thinking off · seed 441 · max_tokens 16000

按提示 wall

promptSparkAMDAMD+4080
game-01284s · 36.5 t/s · 10.4k tok426s · 26.5 · 11.3k522s · 25.2 · 13.1k
arch-01162s · 38.1 · 6.2k314s · 26.6 · 8.4k356s · 25.4 · 9.0k
space-02294s · 38.0 · 11.2k490s · 26.4 · 12.9k448s · 25.3 · 11.3k

结果 HTML

SparkAMDAMD+4080
game-01HTMLHTMLHTML
arch-01HTMLHTMLHTML
space-02HTMLHTMLHTML

怎么读

  • Spark 在 wall 与 tok/s 全胜(相对 Vulkan GGUF 约 1.6–1.8×)。
  • 4080 spill = 容量。 能装下就用纯 AMD;大模型/长上下文再开 spill。
  • render_ok=0 是 Playwright 门未过,不是“没有画面”。
  • 完整 12×4 矩阵尚未跑——目前仅 Flash-Next 冒烟 3 条。

原始:results/visual-compare/t16k-{spark,evo-amd,evo4080}-flash/ · 2026-09-04。