Skip to content

cuda+server: q8_0 K/V at the full 262k window on 12 GB (tiered VMM KV cache), MTP drafting at every depth - #285

Closed
professorpalmer wants to merge 6 commits into
PrismML-Eng:prismfrom
professorpalmer:claude/q8-262k-tier
Closed

professorpalmer wants to merge 6 commits into
PrismML-Eng:prismfrom
professorpalmer:claude/q8-262k-tier

cuda: GGML_CUDA_OP_TIMING=1 per-node GPU time breakdown

3164035
Select commit
Loading
Failed to load commit list.
Sign in for the full log view

Annotations

1 warning
labeler
succeeded Sep 29, 2026 in 15s