vLLM 的 transformers 建模后端实现原生速度
Hugging Face 宣布 vLLM 的 transformers 建模后端现已达到甚至超过 vLLM 手写原生实现的推理速度,模型作者无需移植即可获得超快 vLLM 推理。
推荐理由:原文给出 transformers 后端在 vLLM 中达到原生速度的实测与启用方式,读者可据此判断是否省去自定义移植。
AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。
Hugging Face 宣布 vLLM 的 transformers 建模后端现已达到甚至超过 vLLM 手写原生实现的推理速度,模型作者无需移植即可获得超快 vLLM 推理。
推荐理由:原文给出 transformers 后端在 vLLM 中达到原生速度的实测与启用方式,读者可据此判断是否省去自定义移植。
Microsoft 在 Build 2026 宣布 Foundry Managed Compute 与 Hugging Face 模型集合,将开源权重模型一键部署到托管 GPU 平台。
推荐理由:原文给出托管计算与模型目录的部署路径,读者可据此判断开源模型在企业环境中的落地方式。
SkyPilot 与 Hugging Face 联合推出 store: hf 后端,用一条 hf:// URL 和现有 HF_TOKEN 即可把 Hugging Face Bucket 或任意模型、数据集、Space 仓库挂载进 SkyPilot 任务,在 20+ 云、Kubernetes、Slurm 和本地集群上运行。
推荐理由:原文给出跨云挂载 Hub 存储的配置方式与免出网费说明,读者可据此判断多云训练的数据搬运成本。
Hugging Face 发布 LeRobot v0.6.0,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新一批 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT)以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:原文完整列出世界模型策略、奖励模型 API 与六个仿真基准,读者可据此判断机器人学习闭环的可用工具链。
Hugging Face 与 Cerebras 联合演示了一套实时语音到语音流水线,用 Cerebras 加速 Gemma 4 31B 推理以降低延迟。该架构为开源模块化设计,依次经过 Nvidia Parakeet 语音识别、Gemma 4 VLM 推理和阿里 Qwen3TTS 语音合成。
推荐理由:原文给出可复用的开源语音到语音流水线架构,读者可据此了解低延迟实时对话的实现路径。
DeepSeek API 采用硬盘缓存技术,将价格再降低一个数量级。官方文档显示上下文缓存功能于 2024/08/02 上线,更多更新细节可查阅该文档。
推荐理由:DeepSeek API 用硬盘缓存降低调用价格,读者可据此判断长上下文场景的成本变化。