From b92a9598a4e06be9c8cc15a82f2a48e7566b8994 Mon Sep 17 00:00:00 2001 From: Ronald Tse Date: Sat, 29 Aug 2026 19:53:31 +0800 Subject: [PATCH] fix: re-apply explicit d_kv passthrough (regressed in the resumability commits) ByT5 keeps d_kv=64 at any width; the d_model/heads derivation built inner dims of 1470 for the layerdrop student and crashed the bridge. --- src/gpu/modal_distill.py | 4 ++-- 1 file changed, 2 insertions(+), 2 deletions(-) diff --git a/src/gpu/modal_distill.py b/src/gpu/modal_distill.py index fd1ddae..22c0c88 100644 --- a/src/gpu/modal_distill.py +++ b/src/gpu/modal_distill.py @@ -659,7 +659,7 @@ def distill_sequence(spec_id: str, epochs: int = 3) -> dict: vocab_size=259, d_model=cfg.get("d_model", 384), d_ff=cfg.get("d_ff", 1536), - d_kv=cfg.get("d_model", 384) // cfg.get("num_heads", 6), + d_kv=cfg.get("d_kv", cfg.get("d_model", 384) // cfg.get("num_heads", 6)), num_layers=cfg.get("enc_layers", 8), num_decoder_layers=cfg.get("dec_layers", 8), num_heads=cfg.get("num_heads", 6), @@ -1217,7 +1217,7 @@ def distill_microkimi(spec_id: str, epochs: int = 3, calib_batches: int = 64, vocab_size=259, d_model=cfg.get("d_model", 384), d_ff=cfg.get("d_ff", 1536), - d_kv=cfg.get("d_model", 384) // cfg.get("num_heads", 6), + d_kv=cfg.get("d_kv", cfg.get("d_model", 384) // cfg.get("num_heads", 6)), num_layers=cfg.get("enc_layers", 8), num_decoder_layers=cfg.get("dec_layers", 8), num_heads=cfg.get("num_heads", 6),