Flash-Next 시각 비교 16k: Spark vs AMD vs AMD+4080
Flash-Next 16k 3박스 속도 비교 + 사람 눈 품질 한계. 자동 hit는 과대평가; 게임은 시네마틱 정지장면, space-02는 로켓/전투기 드리프트.
한 줄. Flash-Next를 같은 3프롬프트 · seed=441 · max_tokens=16000으로 Spark / EVO AMD-only / EVO AMD+4080에서 돌렸다. 속도는 Spark ≫ AMD ≈ AMD+4080. 다만 사람 눈으로 보면 결과물 품질은 대체로 실패에 가깝다 — 자동 hit_ratio·closed_html은 “키워드/태그 있음”일 뿐, 장면이 맞거나 게임이 동작한다는 뜻이 아니다.
팩 정의: 시각 비교 팩 v1. 스모크 프롬프트: game-01 · arch-01 · space-02. HTML은 Three.js CDN. Playwright render_ok는 세 박스 모두 0/3(닫힌 HTML이어도 게이트 미통과).
Totals
| Spark | EVO AMD | EVO AMD+4080 | |
|---|---|---|---|
| mean wall | 247s | 410s | 442s |
| decode | ~37 tok/s | ~26.5 | ~25.3 |
| mean hit_ratio | 0.89 | 0.94 | 0.89 |
| closed_html | 3/3 | 3/3 | 3/3 |
| render_ok | 0/3 | 0/3 | 0/3 |
사람 눈 · 품질 한계 (중요)
배포 HTML을 직접 열어보면:
- 안 나오거나 거의 빈 화면인 케이스가 있다. Playwright
render_ok가 전 박스 0/3인 이유와 같다. - game-*: 프롬프트 자체가 “플레이 가능 게임”이 아니라 시네마틱 스크린샷이었다. 실제 산출물에도
keydown/WASD가 없고, 카메라 루프만 있는 정지 장면이다. “게임이 안 돈다”는 기대와 프롬프트가 어긋났다. - space-02: 요구는 행어 안 은색 기체 + 주황 엔지니어 3 + 상자 + 파란 로봇 + 문 너머 행성. 코드 주석/타이틀은 Hangar라고 써도, 메시 조합이 로켓/전투기 실루엣으로 보이는 드리프트가 난다. 문자열 체크는
spacecraft/hangar단어만 세서 통과시킨다. - arch-01이 상대적으로 덜 깨지지만, 그래도 “포토리얼 건축 비주얼” 수준은 아니다.
즉 이번 런의 유효한 결론은 박스 간 속도·용량이지, “Flash-Next가 멋진 3D를 잘 만든다”가 아니다. 다음 팩(v2)에서는 (1) 플레이 가능 게임 vs 정지 장면 분리, (2) NOT rocket launch / NOT open space dogfight 같은 네거티브 고정, (3) 문자열 대신 비전/사람 채점을 기본으로 바꿔야 한다.
AMD+4080은 VRAM 말고 이득이 있나?
이 워크로드에서는 거의 없다. Flash-Next ROCmFP4가 AMD 단독(-dev Vulkan0 -c 32768)으로 이미 들어가면, 4080을 layer spill(-sm layer -ts 56,8)로 붙이는 비용(PCIe·레이어 분할)이 그대로 wall에 붙는다. 측정값도 AMD 410s vs AMD+4080 442s — spill이 ~8% 더 느리다.
- 이득이 되는 경우: 가중치·KV가 AMD VRAM에 안 들어갈 때, 또는
-c를 크게 올려야 긴 HTML이 잘리지 않을 때(이전 quality×cost에서-c 4096절단 → 32k 필요). - 이득이 없는 경우: 이번처럼 모델+컨텍스트가 AMD에 이미 들어갈 때. 속도·체크리스트 모두 AMD 단독이 같거나 나음.
- 품질: hit_ratio는 AMD 단독이 미세 우위(특히 arch-01 0.83 vs 0.67). 4080이 “더 예쁘게” 만들지는 않음.
Setup
| Spark | EVO AMD | EVO AMD+4080 | |
|---|---|---|---|
| serve | SGLang NVFP4 :30000 | llama.cpp Vulkan0 :8080 | llama.cpp Vulkan1,0 -ts 56,8 |
| weights | Flash-Next NVFP4 | ROCmFP4-FAST ple16 | 동일 GGUF |
| params | temp 0.4 · thinking off · seed 441 · max_tokens 16000 | ||
프롬프트별 wall
| prompt | Spark | AMD | AMD+4080 |
|---|---|---|---|
| game-01 | 284s · 36.5 t/s · 10.4k tok | 426s · 26.5 · 11.3k | 522s · 25.2 · 13.1k |
| arch-01 | 162s · 38.1 · 6.2k | 314s · 26.6 · 8.4k | 356s · 25.4 · 9.0k |
| space-02 | 294s · 38.0 · 11.2k | 490s · 26.4 · 12.9k | 448s · 25.3 · 11.3k |
결과 HTML
읽는 법
- Spark가 wall·tok/s 모두 1등. 같은 Flash-Next라도 NVFP4+SGLang이 Vulkan GGUF보다 ~1.6–1.8× 빠름.
- 4080 spill = capacity. 이미 fit이면 AMD-only로 두고, 큰 모델·긴 컨텍스트에만 spill을 켠다.
- render_ok=0은 “장면이 없다”가 아니라 Playwright 게이트(RAF/루프 등) 미충족. 체크리스트·닫힌 HTML은 통과.
- 12프롬프트 × 4모델 풀 매트릭스는 아직 스모크 3개·Flash-Next만.
원본: results/visual-compare/t16k-{spark,evo-amd,evo4080}-flash/ · 2026-09-04.