Hugging Face tokenizers v1 发布:编码解码与扩展性能实测
Hugging Face 发布 tokenizers v1,输出与 v0.23 完全一致的 token ID,但速度常快数十倍。v1 将单个 crate 拆为 workspace,引入无分配模型、基于 SIMD 的 bitcannon 分词、合并循环重写、词缓存和原生多线程并行,并保留对 BPE、WordPiece、Unigram 的支持。
Hugging Face 发布 tokenizers v1,输出与 v0.23 完全一致的 token ID,但速度常快数十倍。v1 将单个 crate 拆为 workspace,引入无分配模型、基于 SIMD 的 bitcannon 分词、合并循环重写、词缓存和原生多线程并行,并保留对 BPE、WordPiece、Unigram 的支持。
Hugging Face 博客发布教程,用 TRL 库的 GRPO 对 LFM2.5-350M 做约 500 样本、100 步微调,在 IFStruct benchmark 上把通过率从 22.6% 提升到 29.7%。训练可在免费 Colab 或 Kaggle GPU 上完成,评测则通过 llama.cpp 在 MacBook 本地运行,代码已开源在 GitHub。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,支持 ColBERT 式后期交互检索,并提供完整训练方案。
AWS 开源 SDK Strands Robots(Apache 2.0)演示了机器人数据的流式闭环:用 Robot("so100") 录制 LeRobotDataset 并同步到 Hugging Face Storage Buckets。
Hugging Face 发布论文提出两项系统改进,让 LLM 知识蒸馏成本大幅下降:离线缓存教师模型每位置的 top-100 logits,使教师模型无需与学生模型同时驻留显存;融合分块 KL 损失避免生成完整的词表×序列长度矩阵。
Hugging Face 为 Kernels 项目引入 Hub 上的 "kernel" 新仓库类型,并新增可信发布者与代码签名两层安全机制,默认只加载可信发布者的 kernel,其他来源需显式设置 trust_remote_code=True。CLI 方面 kernels 与 kernel-builder 职责分离,框架支持新增 Torch Stable ABI 与 Apache TVM FFI。
Hugging Face 发布开源基准 ScarfBench,用于评估 AI 智能体在企业级 Java 框架迁移中的表现,覆盖 Spring、Jakarta EE、Quarkus 三大生态,含 34 个应用、102 个框架实现和 204 个迁移任务。
Hugging Face 博客介绍 DiScoFormer(Density and Score Transformer),一个模型在单次前向传播中即可从一组数据点估计分布的密度与 score,无需针对新分布重新训练。