阿里 Qwen-Audio-3.1-TTS 登顶 Artificial Analysis 语音榜
9 月 28 日,阿里巴巴的语音大模型 Qwen-Audio-3.1-TTS 在 Artificial Analysis 的语音排行榜 Controlled Voice Arena 上以 1177 的 Elo 评分位列全球第一。
9 月 28 日,阿里巴巴的语音大模型 Qwen-Audio-3.1-TTS 在 Artificial Analysis 的语音排行榜 Controlled Voice Arena 上以 1177 的 Elo 评分位列全球第一。
DeepSeek 通过官方公众号宣布开源面向华为昇腾算力平台的基础设施组件,涵盖 TileLang 高级语言编译工具、计算库和分布式通信库,与面向英伟达平台的开源组件一一对应。
NVIDIA 发布开源表格基础模型 Kumo Tabular,给定带标签的表格行即可在单次前向传播中预测新行标签,无需训练、调参和特征工程,同时支持分类与回归。
推荐理由:NVIDIA 开源表格基础模型,无需训练与特征工程即可单次前向预测,并给出四个基准的排名与速度对比。
至知创新研究院IQuest Research发布IQuest-Q1模型,采用decoder-only Transformer主干与稀疏MoE架构,总参数约320B、激活参数约15B。
H 公司发布 Holo4 系列智能体模型,包含 27B dense 和 35B-A3B MoE 两个尺寸,均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。
推荐理由:Holo4 同时给出两种尺寸、多接口能力和开源轨迹,读者可据此判断通用计算机操作智能体的成本与能力边界。
Liquid AI 发布实验性草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入投机解码路径,端侧解码最高提速 3.13x、H100 上最高 2.66x,端到端最高提升 2.62x 和 2.27x。
小米 MiMo 团队公开 MiMo-V3 的新推理架构 HySparse2,面向长程多轮 Agent,目标是减少 Prefill 计算、缩小 KV Cache 并提升长上下文检索精度。相比 MiMo-V2.6 的 Hybrid SWA,该架构将 KV 共享提升两级,Prefill 计算量减少一半。
飞捷科思全面开源 Fysiverse-3D,这是其 Fysiverse 物理世界模型体系中面向三维世界构建的系列工作。该系列覆盖从一句话到一个可执行世界的完整链路,其中可验证空间文生图方案 SpatialGuard 对自然语言中的空间意图进行显式规划,生成空间关系准确、可验证的视觉观测,为下游重建提供可靠输入。
飞捷科思开源 OmniFysics“双子星”,在 24 项评测中拿下世界第一。该模型面向物理层面的世界理解,综合图像、视频、声音与语言,用于运动预测、碰撞分析乃至驱动机器人行动,并输出可计算、可验证的物理参数作为决策依据。