跳到正文
原文
Hugging Face 博客·· 27 天前AI 评分34

用 100 步 GRPO 微调 LFM2.5-350M 提升结构化输出

Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps

AI 导读

Hugging Face 博客发布教程,用 TRL 库的 GRPO 对 LFM2.5-350M 做约 500 样本、100 步微调,在 IFStruct benchmark 上把通过率从 22.6% 提升到 29.7%。训练可在免费 Colab 或 Kaggle GPU 上完成,评测则通过 llama.cpp 在 MacBook 本地运行,代码已开源在 GitHub。

来源:Hugging Face 博客 · hf-mirror.com