Jeff 开源发布:22 毫秒出一次决策的小模型,0.8B 微调在 benchmark 上逼近 Jev
开源项目 Jeff 发布,定位为零样本分类器,基于 Qwen3.5 和 Gemma 4 微调,一次前向计算即返回每个选项的校准概率,不生成文本、无需解析。在 RTX PRO 6000 上约 22 毫秒出一次决策,0.8B 微调版本在 benchmark 上逼近 Jev。
开源项目 Jeff 发布,定位为零样本分类器,基于 Qwen3.5 和 Gemma 4 微调,一次前向计算即返回每个选项的校准概率,不生成文本、无需解析。在 RTX PRO 6000 上约 22 毫秒出一次决策,0.8B 微调版本在 benchmark 上逼近 Jev。
Liquid AI 发布实验性草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入投机解码路径,端侧解码最高提速 3.13x、H100 上最高 2.66x,端到端最高提升 2.62x 和 2.27x。
小米 MiMo 团队公开 MiMo-V3 的新推理架构 HySparse2,面向长程多轮 Agent,目标是减少 Prefill 计算、缩小 KV Cache 并提升长上下文检索精度。相比 MiMo-V2.6 的 Hybrid SWA,该架构将 KV 共享提升两级,Prefill 计算量减少一半。
DeepSeek 正式发布 DeepSeek-V4.1-Flash,这是其新架构家族中最小、原生支持多模态视觉理解的模型,官方称新架构面向更高能力上限、更快推理和更高吞吐。
推荐理由:官方给出新架构家族最小模型的完整基准与 API 变更,可据此判断多模态调用与旧模型迁移成本。