Hugging Face 博客·· 2026-08-10AI 评分39
Hugging Face 提出高效知识蒸馏方法:离线 Top-K Logits 与融合分块 KL 损失
Making Knowledge Distillation Cheap Enough to Run at Scale
AI 导读
Hugging Face 发布论文提出两项系统改进,让 LLM 知识蒸馏成本大幅下降:离线缓存教师模型每位置的 top-100 logits,使教师模型无需与学生模型同时驻留显存;融合分块 KL 损失避免生成完整的词表×序列长度矩阵。
来源:Hugging Face 博客 · hf-mirror.com