AIAI Tech Engine
首页/基准/Flash-Next + RTX 4080 spill:Spark vs EVO-X3 quality×cost
#DGX Spark#EVO-X3#Flash-Next#RTX4080#quality×cost#spill

Flash-Next + RTX 4080 spill:Spark vs EVO-X3 quality×cost

EVO 上用 RTX 4080 Vulkan layer spill 跑 Flash-Next 三阶段赛。Spark wall_sum 1083s vs EVO+4080 5321s。arch3d EVO 先过;angry EVO 12/12 失败。

AIAI Tech Engine Lab
独立测试台实测
SPONSORED / ADVERTISEMENT
예약된 광고 영역

一句话。 EVO-X3(AMD 8060S)加 RTX 4080 layer spill 后 Flash-Next 能否跑、Playwright render_ok 相对 Spark 如何变。结果:能跑。wall_sum:Spark 1083s vs EVO+4080 5321s(约 5×)。angry 上 EVO 12/12 失败。

栈:Spark = NVFP4 · SGLang · :30000。EVO = ROCmFP4 GGUF · llama.cpp Vulkan1+Vulkan0 · -ts 56,8 · -c 32768 · :8080。协议同 quality×cost(arch3d → angry → snake,dynamic N)。

Totals

SparkEVO + RTX 4080
arch3d → first pass357s (r2)267s (r1)
angry → first pass628s (r3)12/12 fail (cap)
snake → first pass98s (r1)367s (r2)
stages passed3/32/3
wall_sum1083s (~18 min)5321s (~89 min)
decode (pass rounds)~37 tok/s~21–26 tok/s

4080 spill 证明能加载、能推理。带质量门时 Spark 便宜得多。EVO 的瓶颈不只是速度,而是 angry HTML 过不了 gate

Setup · 4080 spill

DGX SparkEVO-X3 + 4080
GPUGB10 UMA ~128GB8060S + RTX 4080 (Vulkan1,Vulkan0)
weightsFlash-Next NVFP4Flash-Next ROCmFP4-FAST ple16 GGUF (~88G)
serveSGLang-sm layer -ts 56,8 -c 32768 --jinja
note-c 4096 时输出在 ~3.8k 截断,closed_html 失败;arch3d 需 32k。

Stage 1 · arch3d

EVO r1 即过(267s),比 Spark 首次通过(357s / r2)更短。上下文够长能收尾时,两边 3D HTML 都能过 gate。

Spark · r2 pass · HTML
Spark Flash-Next arch3d pass

37.3 tok/s · 122s · 4559 tok

EVO+4080 · r1 pass · HTML
EVO+4080 Flash-Next arch3d pass

25.6 tok/s · 267s · closed_html OK

Stage 2 · angry

Spark r3 通过(628s)。EVO+4080:12/12 render_ok=false,常缺 requestAnimationFrame / 输入钩子。烧满 8k token 仍出不来可玩弹弓。比先前 AMD-only Flash(angry 最终通过)更差。

Spark · r3 pass · HTML
Spark angry pass
EVO+4080 · r1 fail · HTML
EVO+4080 angry fail

Stage 3 · snake

两边都过。Spark r1(98s · 37 tok/s),EVO r2(367s · 20 tok/s)。

Spark · r1 · HTML
Spark snake
EVO+4080 · r2 · HTML
EVO+4080 snake

怎么读

  • 4080 spill 可行:~88G Flash-Next 可用 AMD+NVIDIA layer split serve;-c 要够大。
  • 质量≠速度:EVO decode 约 Spark 的 70%;wall_sum 差距主要来自 angry 重试。
  • 先前 AMD-only Flash(wall_sum 3374s)不是干净 A/B——本文只看加 4080 后同一 gate

源:pipeline-flashnext-spark-vs-4080-v2/pipeline-20260903T151241Z.json · makespan 5403s。