Hugging Face 博客·· 2026-08-25精选AI 评分60
Multiverse Computing 提出 Quantization-Aware Healing,4-bit 压缩模型在 9 项基准中 7 项超过全精度版本
Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original
AI 导读
Multiverse Computing 发布论文提出 Quantization-Aware Healing(QAH),直接从未压缩的原始模型蒸馏到已结构压缩并量化的学生模型,而非从恢复后的 bfloat16 检查点蒸馏。
推荐理由
论文给出压缩加量化模型的恢复配方,读者可了解 4-bit 模型反超全精度版本的训练路径与稳定性差异。
来源:Hugging Face 博客 · hf-mirror.com