热点事件持续更新
大模型Attention架构从分流走向重组
1 篇报道1 个报道来源6 小时前更新
先了解这件事
AI 综述
2026年9月30日,雷锋网梳理大模型Attention路线变迁,指出GLM-5.3-Flash的45层架构中,34层采用Kimi路线的KDA线性注意力,11层采用DeepSeek路线的KPool-DSA稀疏注意力,两种此前分属不同厂商的注意力方案出现在同一张模型架构图里。报道将这一现象置于大模型Attention架构从分流走向重组的脉络中讨论。
AI 根据报道生成 · 2 小时前更新
最新进展9月30日 15:45
雷锋网称GLM-5.3-Flash的45层中34层用Kimi的KDA、11层用DeepSeek的KPool-DSA。报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- 雷锋网Kimi 和 DeepSeek,为什么出现在同一张模型架构图里?
雷锋网梳理大模型 Attention 路线的变迁,指出 GLM-5.3-Flash 的 45 层架构中 34 层采用 Kimi 路线的 KDA 线性注意力,11 层采用 DeepSeek 路线的 KPool-DSA 稀疏注意力。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。