跳到正文
热点事件持续更新

大模型Attention架构从分流走向重组

1 篇报道1 个报道来源6 小时前更新

先了解这件事

AI 综述

2026年9月30日,雷锋网梳理大模型Attention路线变迁,指出GLM-5.3-Flash的45层架构中,34层采用Kimi路线的KDA线性注意力,11层采用DeepSeek路线的KPool-DSA稀疏注意力,两种此前分属不同厂商的注意力方案出现在同一张模型架构图里。报道将这一现象置于大模型Attention架构从分流走向重组的脉络中讨论。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. 雷锋网
    Kimi 和 DeepSeek,为什么出现在同一张模型架构图里?

    雷锋网梳理大模型 Attention 路线的变迁,指出 GLM-5.3-Flash 的 45 层架构中 34 层采用 Kimi 路线的 KDA 线性注意力,11 层采用 DeepSeek 路线的 KPool-DSA 稀疏注意力。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。