Flash-Next + RTX 4080 spill: Spark vs EVO-X3 quality×cost
EVO에 RTX 4080을 Vulkan spill로 붙인 Flash-Next 3스테이지 race. Spark wall_sum 1083s vs EVO+4080 5321s. arch3d는 EVO가 먼저 통과, angry는 EVO 12회 전부 fail.
한 줄. EVO-X3(AMD 8060S)에 RTX 4080을 layer spill로 붙인 Flash-Next가 돌아가는지, 그리고 Playwright render_ok 품질이 Spark 대비 어떻게 달라지는지 같은 프로토콜로 쟀다. 돌아간다. 다만 wall_sum은 Spark 1083s vs EVO+4080 5321s (~5×). angry는 EVO가 12/12 fail.
스택: Spark = NVFP4 · SGLang · :30000. EVO = ROCmFP4 GGUF · llama.cpp Vulkan1+Vulkan0 · -ts 56,8 · -c 32768 · :8080. 프로토콜은 기존 quality×cost와 동일(arch3d → angry → snake, dynamic N).
Totals
| Spark | EVO + RTX 4080 | |
|---|---|---|
| arch3d → first pass | 357s (r2) | 267s (r1) |
| angry → first pass | 628s (r3) | 12/12 fail (cap) |
| snake → first pass | 98s (r1) | 367s (r2) |
| stages passed | 3/3 | 2/3 |
| wall_sum | 1083s (~18 min) | 5321s (~89 min) |
| decode (pass rounds) | ~37 tok/s | ~21–26 tok/s |
4080 spill은 로드·추론 가능을 증명한다. 품질 게이트까지 포함한 비용은 Spark가 훨씬 싸다. EVO의 병목은 속도보다 angry HTML이 gate를 못 넘는 것이다.
Setup · 4080 spill
| DGX Spark | EVO-X3 + 4080 | |
|---|---|---|
| GPU | GB10 UMA ~128GB | 8060S + RTX 4080 (Vulkan1,Vulkan0) |
| weights | Flash-Next NVFP4 | Flash-Next ROCmFP4-FAST ple16 GGUF (~88G) |
| serve | SGLang | -sm layer -ts 56,8 -c 32768 --jinja |
| note | — | -c 4096이면 출력이 ~3.8k에서 잘려 closed_html 실패. 32k로 올려야 arch3d pass. |
Stage 1 · arch3d
N 시점 리더는 Spark(seed r2), 그런데 EVO는 r1에서 바로 pass — wall은 EVO가 더 짧다(267s vs Spark 357s). 4080 spill 이후 긴 컨텍스트를 닫을 수 있으면 3D HTML은 통과한다.
37.3 tok/s · 122s · 4559 tok
25.6 tok/s · 267s · closed_html OK
Stage 2 · angry
Spark는 r3에서 pass(628s). EVO+4080은 12라운드 전부 render_ok=false — 대부분 has_raf=false / 루프·입력 훅이 gate에 안 맞음. 8000 tok를 다 써도 플레이 가능한 슬링샷이 안 나온다. 이전 AMD-only Flash race(angry M=3 후 pass)보다 이번 4080-heavy 런이 품질에서 더 나빴다.
Stage 3 · snake
둘 다 pass. Spark r1(98s · 37 tok/s), EVO r2(367s · 20 tok/s).
읽는 법
- 4080 spill = 가능: 88G Flash-Next를 AMD+NVIDIA layer split으로 serve 가능.
-c는 충분히 크게. - 품질≠속도: EVO decode는 Spark의 ~70%. wall_sum 격차의 대부분은 angry 12회 재시도.
- 이전 AMD-only Flash(wall_sum 3374s, angry pass)와 직접 숫자 비교는 컨텍스트/런 조건이 다름. 이번 글은 4080 추가 후 같은 gate만 본다.
원본: pipeline-flashnext-spark-vs-4080-v2/pipeline-20260903T151241Z.json · makespan 5403s.