AIAI Tech Engine
/벤치마크/Flash-Next + RTX 4080 spill: Spark vs EVO-X3 quality×cost
#DGX Spark#EVO-X3#Flash-Next#RTX4080#quality×cost#spill

Flash-Next + RTX 4080 spill: Spark vs EVO-X3 quality×cost

EVO에 RTX 4080을 Vulkan spill로 붙인 Flash-Next 3스테이지 race. Spark wall_sum 1083s vs EVO+4080 5321s. arch3d는 EVO가 먼저 통과, angry는 EVO 12회 전부 fail.

AIAI Tech Engine Lab
독립 테스트베드 실측
SPONSORED / ADVERTISEMENT
예약된 광고 영역

한 줄. EVO-X3(AMD 8060S)에 RTX 4080을 layer spill로 붙인 Flash-Next가 돌아가는지, 그리고 Playwright render_ok 품질이 Spark 대비 어떻게 달라지는지 같은 프로토콜로 쟀다. 돌아간다. 다만 wall_sum은 Spark 1083s vs EVO+4080 5321s (~5×). angry는 EVO가 12/12 fail.

스택: Spark = NVFP4 · SGLang · :30000. EVO = ROCmFP4 GGUF · llama.cpp Vulkan1+Vulkan0 · -ts 56,8 · -c 32768 · :8080. 프로토콜은 기존 quality×cost와 동일(arch3d → angry → snake, dynamic N).

Totals

SparkEVO + RTX 4080
arch3d → first pass357s (r2)267s (r1)
angry → first pass628s (r3)12/12 fail (cap)
snake → first pass98s (r1)367s (r2)
stages passed3/32/3
wall_sum1083s (~18 min)5321s (~89 min)
decode (pass rounds)~37 tok/s~21–26 tok/s

4080 spill은 로드·추론 가능을 증명한다. 품질 게이트까지 포함한 비용은 Spark가 훨씬 싸다. EVO의 병목은 속도보다 angry HTML이 gate를 못 넘는 것이다.

Setup · 4080 spill

DGX SparkEVO-X3 + 4080
GPUGB10 UMA ~128GB8060S + RTX 4080 (Vulkan1,Vulkan0)
weightsFlash-Next NVFP4Flash-Next ROCmFP4-FAST ple16 GGUF (~88G)
serveSGLang-sm layer -ts 56,8 -c 32768 --jinja
note-c 4096이면 출력이 ~3.8k에서 잘려 closed_html 실패. 32k로 올려야 arch3d pass.

Stage 1 · arch3d

N 시점 리더는 Spark(seed r2), 그런데 EVO는 r1에서 바로 pass — wall은 EVO가 더 짧다(267s vs Spark 357s). 4080 spill 이후 긴 컨텍스트를 닫을 수 있으면 3D HTML은 통과한다.

Spark · r2 pass · HTML
Spark Flash-Next arch3d pass

37.3 tok/s · 122s · 4559 tok

EVO+4080 · r1 pass · HTML
EVO+4080 Flash-Next arch3d pass

25.6 tok/s · 267s · closed_html OK

Stage 2 · angry

Spark는 r3에서 pass(628s). EVO+4080은 12라운드 전부 render_ok=false — 대부분 has_raf=false / 루프·입력 훅이 gate에 안 맞음. 8000 tok를 다 써도 플레이 가능한 슬링샷이 안 나온다. 이전 AMD-only Flash race(angry M=3 후 pass)보다 이번 4080-heavy 런이 품질에서 더 나빴다.

Spark · r3 pass · HTML
Spark angry pass
EVO+4080 · r1 fail (대표) · HTML
EVO+4080 angry fail

Stage 3 · snake

둘 다 pass. Spark r1(98s · 37 tok/s), EVO r2(367s · 20 tok/s).

Spark · r1 · HTML
Spark snake
EVO+4080 · r2 · HTML
EVO+4080 snake

읽는 법

  • 4080 spill = 가능: 88G Flash-Next를 AMD+NVIDIA layer split으로 serve 가능. -c는 충분히 크게.
  • 품질≠속도: EVO decode는 Spark의 ~70%. wall_sum 격차의 대부분은 angry 12회 재시도.
  • 이전 AMD-only Flash(wall_sum 3374s, angry pass)와 직접 숫자 비교는 컨텍스트/런 조건이 다름. 이번 글은 4080 추가 후 같은 gate만 본다.

원본: pipeline-flashnext-spark-vs-4080-v2/pipeline-20260903T151241Z.json · makespan 5403s.