线性注意力速览(Linear Attention,2020 ~ 2026)
把历史压缩进定长 state,复杂度 $O(n)$:kernel 线性 / SSM / delta 规则 / TTT / Titans,及 2025 起的混合旗舰 · 检索时间 2026-08-23 · 每篇 = 配方 + 一句话(问题 / 方法 / 核心)
零基础读法:从「记住全部历史」到「只维护一个小状态」
定义:普通 Transformer 注意力在生成每个 token 时都重新读一遍全部历史,所以历史越长越慢。线性注意力改为维护一个固定大小的 state,每来一个 token 就把它「写进」state,之后只用 state 回答问题。
方法:最早的核化线性注意力把 softmax 拆成两个特征映射,把「先算所有历史再输出」变成「先累计一个矩阵 state」。后来发展出门控、delta 规则和状态空间模型,本质都是设计更好的 state 更新规则,让它该记的记、该忘的忘。
模型:代表包括 Linear Transformer、Performer、Mamba/Mamba-2、RWKV、GLA、TTT、Titans,以及后来把 linear 层和 softmax attention 层混用的旗舰模型。
算法:关键操作是「递推 + 扫描」:训练时可以并行扫描整条序列,推理时只做一步递推。不同方法差别在于 state 大小、是否有数据依赖衰减、能不能做精确联想召回。
评测:看 Long Range Arena、语言建模 perplexity、长程 in-context recall、长度外推,以及真实吞吐/解码延迟。线性方法通常快,但「精确回忆几十万 token 里某个细节」可能不如 softmax 注意力。
读每篇时问:state 里存了什么?每步怎么更新?它牺牲了什么能力换来速度?
0. 记法(这个领域的「最大公约数」)
核心矛盾:softmax 注意力每个 token 都要看全部历史,复杂度 $O(n^2)$。线性注意力这条路线用定长 state 压缩全部历史,把复杂度压到 $O(n)$、解码内存 $O(1)$——代价是「记不全」。配方围绕「state 怎么更新」这一轴(另一条路「只算重要的 token 对」见 sparse-attention.html):
| 记号 | 意思 |
|---|---|
dense | 全 softmax 注意力,$O(n^2)$,精确检索但算不起 |
linear(kernel) | 核化线性注意力:$S = S + k\cdot v^{\top}$,定长矩阵 state,$O(n)$ |
linear(gated) | 门控线性注意力:加数据依赖的衰减门,控制遗忘 |
delta | delta 规则:先「删掉旧的」再「写进新的」,能做联想召回 |
gdelta | 门控 delta:门控(快速遗忘)+ delta(精准编辑)二合一 |
ssm | 状态空间模型(Mamba / Mamba-2),选择性转移 |
ttt | test-time training 层:hidden state 本身是个 ML 模型 |
mem | 神经记忆(Titans):按「惊讶度」决定记什么 |
hybrid(linear+dense) | 混合:线性层做长程压缩 + 全注意力层做精确检索 |
配方格式:模型: <注意力/复杂度> -> <能做什么> [state 更新 / 稀疏选择机制]。例:Gated DeltaNet: linear(gdelta) -> $O(n)$ [门控遗忘 + delta 编辑]。
1. 主线:从「快但记不住」到「又快又记得住」
- 2020-2023 线性注意力(kernel 线):把 softmax 换成核函数,注意力变成「固定 size 矩阵 state + 递归更新」,复杂度 $O(n)$、解码 $O(1)$ 内存。代表:Linear Attention、Performer、RetNet、GLA、Lightning Attention-2。优点快,缺点——state 是加性的、只会「越叠越多」,精确 recall(召回某个具体 token)比 softmax 差。
- 2023-2024 SSM 线:Mamba / Mamba-2 用「选择性状态转移」补表达力,xLSTM 用门控复活 LSTM,线性 RNN 跟线性注意力其实是同一族(Mamba-2 的 SSD 框架把 SSM 和注意力统一)。
- 2024-2025 Delta 规则线(转折):DeltaNet 把 state 的更新从「叠加」改成「先删后写」的 delta 规则,精确 recall 大幅回升;Gated DeltaNet 再补一个门控快速遗忘。这是线性注意力「从快但记不住,到又快又记得住」的关键一步。
- 2024-2025 Test-time learning:TTT 把 hidden state 本身做成一个 ML 模型、用 self-supervised 一步更新;Titans 给注意力配一个「按惊讶度记忆」的神经长期记忆。线性注意力有了第三种「更会记」的 state。
- 2025-2026 汇流成混合:Qwen3-Next(Gated DeltaNet + Gated Attention 3:1)、Kimi K2/K3(KDA 线性 + 潜注意力)、Ling-3.0-flash(KDA + MLA 5:1)都表明——纯线性单独不够,把「便宜的线性压缩」和「贵但准的注意力检索」按层混合,才是旗舰的最优解。线性层管长程、全注意力/稀疏层管精确召回;此外低秩 KV(MLA / StepFun MFA)在同一效率谱系里进一步省内存。
- RWKV 系列与 fla 仓库:RWKV-4 立 RNN 路线,Eagle/Finch(RWKV-5/6)换矩阵 state,Goose(RWKV-7)用广义 delta 规则;fla(Flash Linear Attention) 仓库把 GDN / KDA / PaTH / DeltaProduct / FoX / Wall / MoM / Raven 等一整套线性/门控注意力算法统一实现,是这条线的事实标准目录。
三条并行轴:复杂度(dense → linear/ssm → hybrid)、state 更新规则(叠加 → 门控 → delta → ttt/memory)、精确 recall 能力(越往后越接近 softmax)。稀疏注意力那条路单独成篇,见 sparse-attention.html。
2. 先读这两篇(综述 + 对比)
按规范,先读 survey。这两篇一个给「谁最强」的横评,一个给「四种 delta 变体怎么区分的统一记法」,是快速建立地图的入口。
On Subquadratic Architectures: From Applications to Principles(2606.12364,2026)
survey(xLSTM vs Mamba-2 vs Gated DeltaNet) -> 谁最强 + 统一表述 [代码/时序/蒸馏三任务]
问题 子平方架构一堆,到底哪个设计最有效;方法 统一表述后,在代码预训练、从 LLM 蒸馏代码模型、时序基础模型三个任务上对比 xLSTM / Mamba-2 / Gated DeltaNet;核心 xLSTM 综合最强,并用统一公式分析出它的优势来自哪里。
Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing(2607.07953,2026)
survey(DeltaNet/Gated DeltaNet/KDA/Gated DeltaNet-2) -> 统一 state 记法 + 差异表 [350M 模型 / 15B token]
问题 四种 delta 家族注意力表面相似、差别不清;方法 用一套「递归记忆」记法把它们统一,明确各自在表达力、衰减、擦除/写入控制、吞吐、实现复杂度上的差异,并做跨层路由实验;核心 一张表说清 DeltaNet 系谱系里谁改了哪一处。
Provably Shorter Scratchpads in Hybrid DeltaNet-Attention Decoders(2605.16640,2026)
theory(hybrid 递归+注意力) -> 形式化优势证明 [parity / scratchpad 任务]
问题 Qwen3-Next 这类「Gated Attention + Gated DeltaNet」混合到底有没有形式上的优势;方法 在常精度假设下证明混合解码器在 parity 等任务上 scratchpad 更短;核心 首次给出「混合线性+注意力」优于纯递归/纯注意力的理论证据。
3. 线性注意力(kernel 线:把历史压进定长矩阵 state)
最早的「逃 $O(n^2)$」路线:把 softmax 里的指数核换成可分解的核函数 $\phi(q)\cdot\phi(k)$,于是注意力可写成 $S \leftarrow S + k\cdot v^{\top}$ 的递归,训练 $O(n)$、解码 $O(1)$ 内存。演进是:Linear Attention 立范式 → Performer 用随机特征近似 softmax → RetNet 加衰减 → GLA 把衰减变成数据依赖 → Lightning Attention-2 用分块打掉 cumsum 瓶颈 → Based 讲清「state 尺寸 vs 召回」的权衡。核心矛盾一直是「state 太小记不住」,这节就是这条线怎么一步步修 recall。
Linear Attention(Transformers are RNNs)(2006.16236,Katharopoulos et al. 2020)
linear(kernel) -> $O(n)$ 训练 + $O(1)$ 推理内存 [$S = S + k\cdot v^{\top}$]
问题 自注意力 $O(n^2)$ 算不起长序列;方法 把 softmax 换成核函数,注意力变成「矩阵 state 的线性递归」,训练可并行、推理是 RNN;核心 线性注意力的开山,确立了「state 压缩」这条路;后续 RetNet / GLA 指出纯加性 state 没有衰减、recall 差,DeltaNet 又把它改成可编辑记忆——路线没被放弃,而是靠 delta 规则一步步修 recall。
Performer(Rethinking Attention with Performers)(2009.14794,Choromanski et al. 2021)
linear(random feature) -> $O(n)$ [用随机特征近似 softmax 核]
问题 核化线性注意力怎么逼近 softmax、又不显式算注意力矩阵;方法 用正随机特征(FAVOR+)近似 softmax 核;核心 证明 softmax 注意力也能被线性化近似,理论完备;后续工作指出随机特征近似误差大、精确 recall 不如 softmax,工业里很少单独使用,这条线基本被门控 / 数据依赖 / delta 线取代。
RetNet(Retentive Network)(2307.08621,Sun et al. 2023)
linear(衰减 retention) -> 训练并行 + $O(1)$ 推理 [$S = \gamma S + k\cdot v^{\top}$]
问题 线性注意力缺「距离衰减」,远 token 和近 token 一视同仁;方法 给 state 加指数衰减 $\gamma$,支持并行/递归/分块三种等价计算;核心 把「衰减」引入线性注意力,LLM 级可扩展的早期代表;后续 GLA 指出固定衰减不随输入变、recall 仍有限,改成数据依赖门控——RetNet 的衰减思想被继承、固定门被弃。
GLA(Gated Linear Attention,FlashLinearAttention)(2312.06635,Yang et al. 2023)
linear(gated) -> 数据依赖遗忘 + 硬件高效 [$G_t \odot S + k\cdot v^{\top}$]
问题 RetNet 的衰减是固定的、不随输入变;方法 把衰减门 G_t 变成数据依赖(每个 token 自己决定忘多少),并给出 I/O 感知的分块算法;核心 门控线性注意力的标准范式,FlashLinearAttention 成为后续很多工作的底座;后续 DeltaNet 指出加性 state 只会叠加、不能修正旧值,改成「先删后写」——GLA 的门控思想被继承,加性 state 被 delta 规则改掉。
Lightning Attention-2(2401.04658,Qin et al. 2024,MiniMax)
linear(tiled) -> 恒定速度、任意长度 [分块打破 cumsum 瓶颈]
问题 因果线性注意力的累计求和(cumsum)让它在实际里快不起来;方法 用「分块 + 块内并行」的 tiling 策略,消除 cumsum 瓶颈;核心 第一个真正做到「长度任意、速度恒定」的线性注意力实现,是 MiniMax 旗舰的底座;后续 delta / 混合架构指出它 state 表达仍弱,把实现加速留下、把 state 更新换成更可表达的规则。
Based(Simple Linear Attention)(2402.18668,Arora et al. 2024)
linear(Taylor 特征) + 滑窗 -> 召回-吞吐权衡 [定长 state 的 recall 上限]
问题 线性模型的 state 大小和 recall 能力到底是什么关系;方法 用 Taylor 特征近似 softmax + 滑窗注意力,理论+实验刻画「state 尺寸 vs 召回」的权衡;核心 说清了一个根本约束:定长 state 必然有 recall 上限;后续 delta 规则用「可编辑记忆」在这个上限内提升联想召回,Based 的权衡刻画被当作地基保留。
ABC(Attention with Bounded-memory Control)(2110.02488,Peng et al. 2021)
linear(有界记忆) -> $O(n)$ [统一各类高效注意力 + 可学习记忆组织]
问题 注意力上下文像随机访问内存,序列越长读越贵;方法 用「有界记忆控制」把各种高效注意力统一成一个抽象,并用可学习的上下文记忆组织函数;核心 早期把线性/稀疏注意力统一起来的框架,是 fla 仓库列表里的地基之一。
Rebased(Learnable Kernel Linear Transformer)(2402.10644,Aksenov et al. 2024)
linear(可学习核) -> in-context 能力提升 [改造 Based 核]
问题 SSM / 线性模型 in-context learning 弱于 Transformer;方法 对 Based 的核做一个可学习改动,提升 multi-query associative recall 和语言建模;核心 说明「核长什么样」直接决定线性模型的 in-context 能力。
LightNet(You Only Scan Once)(2405.21022,Qin et al. 2024)
linear(加法递推) -> 多模态单次扫描 [替代乘法递推]
问题 线性注意力的乘法递推在多维数据要多次扫描、低效;方法 提出加法线性递推,一次扫描处理多维数据,配 MD-TPE / MD-LRPE 位置编码;核心 把线性注意力扩展到图像 / 多模态的单次扫描框架。
GSA(Gated Slot Attention)(2409.07146,Zhang et al. 2024,NeurIPS 2024)
linear(softmax 门控槽) -> 召回强 + T2R 友好 [两层 GLA 经 softmax]
问题 线性注意力召回差、从头训练贵;方法 两层 GLA 用 softmax 连接做「门控槽注意力」,保留 softmax 便于把预训练 Transformer 转 RNN(T2R);核心 in-context 召回和微调转换场景强。
4. SSM / 线性 RNN(Mamba 线:选择性转移)
不搞核函数,而是把序列建模直接写成状态空间 / 门控 RNN。三条支线:Mamba 让转移参数依赖输入(选择性 SSM)、Mamba-2 用 SSD 证明「SSM 和注意力本质是一家」、xLSTM 用指数门控 + 矩阵记忆把 LSTM 复活到 LLM 规模;RWKV 则独立走出 RNN 递推的线性路线。核心是「线性复杂度 + 内容感知」能不能追上注意力。
Mamba(Selective SSM)(2312.00752,Gu & Dao 2023)
ssm(selective) -> $O(n)$ [输入依赖的状态转移]
问题 经典 SSM 转移矩阵固定、表达力弱;方法 让转移参数依赖输入(选择性 SSM)+ 硬件感知算法;核心 SSM 路线复兴,线性复杂度 + 内容感知的标杆(详见 long-context);后续 Mamba-2 指出 SSM 与注意力理论割裂、精确检索不足,用 SSD 统一,混合架构再补 attention——选择性 SSM 被继承为底座。
Mamba-2 / SSD(Transformers are SSMs)(2405.21060,Dao & Gu 2024)
ssm(SSD) -> 统一 SSM 与注意力 + 2-8× 更快 [半可分矩阵分解]
问题 SSM 和注意力看起来是两套东西、理论割裂;方法 用「结构化半可分矩阵」把它们统一:SSM = 带因果掩码的注意力特例;核心 state space duality(SSD)框架,证明线性 RNN 和注意力是同一族,Mamba-2 的核心层更快更强。
xLSTM(Extended LSTM)(2405.04517,Beck et al. 2024)
linear(门控 RNN) -> 复活 LSTM 到 LLM [mLSTM 矩阵记忆 + sLSTM]
问题 LSTM 被 Transformer 取代,但 RNN 的线性复杂度有价值;方法 用指数门控 + 矩阵记忆(mLSTM)和标量记忆(sLSTM)现代化 LSTM;核心 让 LSTM 重新能训 LLM,是综述里「代码/时序最强」的子平方架构;后续少有单独做成旗舰,更多被混合架构吸收为组件,这条「纯 xLSTM」路线基本搁置。
RWKV-4(Reinventing RNNs)(2305.13048,Peng et al. 2023)
linear(RNN) -> $O(n)$ [WKV 线性注意力 + 时移混合]
问题 Transformer $O(n^2)$;方法 把注意力改写成可 RNN 递推的线性形式;核心 独立提出的 $O(n)$ LLM 路线(详见 long-context);后续 RWKV-5/6/7 指出标量 state 表达力弱、recall 有限,改成矩阵 state 再到向量门控 delta——RWKV 线持续改、没被弃。
Eagle & Finch(RWKV-5 / RWKV-6)(2404.05892,Peng et al. 2024)
linear(矩阵 state + 动态递推) -> 表达力提升 [multi-head 矩阵 state]
问题 RWKV-4 标量 state 表达力有限;方法 引入多头矩阵值 state 和动态递推机制(Eagle=RWKV-5、Finch=RWKV-6),配 1.12T 多语料;核心 Eagle 0.46B-7.5B、Finch 1.6B/3.1B,RWKV 从标量走向矩阵 state。
RWKV-7 "Goose"(2503.14456,Peng et al. 2025)
linear(向量门控 delta) -> 状态追踪 + 全正则语言 [泛化 delta 规则]
问题 需要更强的 state 动态和可表达性;方法 提出向量值门控 + in-context 学习率 + 松弛 value 替换的广义 delta 规则;核心 2.9B 多语 3B 级 SoTA、能追踪状态并识别所有正则语言,训练仍可并行。
Mamba-3(2603.15569,Lahoti et al. 2026,ICLR 2026)
ssm(SSD 离散化 + 复值 + MIMO) -> 状态追踪/检索强 [inference-first]
问题 现有线性模型状态追踪差、线性推理硬件不高效;方法 三招:SSM 离散化导出更表达的递推、复值状态更新、多输入多输出(MIMO);核心 1.5B 下游比 GDN 高 0.6 点、MIMO 再高 1.2 点,state 只用 Mamba-2 一半。
HGRN2(Gated Linear RNNs with State Expansion)(2404.07904,Qin et al. 2024,COLM 2024)
linear(外积 state 扩展) -> 表达力提升 + 硬件高效 [零参数扩 state]
问题 HGRN 的 state 太小限制表达力;方法 用外积 state 扩展在不加参数下放大 state,并给出线性注意力解释;核心 门控线性 RNN 里「扩 state」的代表。
5. Delta 规则线(把 state 从「叠加」变成「可编辑记忆」)
线性注意力 recall 差的根因:$S \leftarrow S + k\cdot v^{\top}$ 只会叠加、不会「修正」。Delta 规则把更新改成「先删掉 key 相关的旧值,再写新值」,联想召回大幅回升。这是 2024-2026 线性注意力最活跃的一支,也是 Kimi K2/K3 和 Qwen3-Next 的线性层。
DeltaNet(Parallelizing Linear Transformers with the Delta Rule)(2406.06484,Yang, Wang, Shen 2024)
linear(delta) -> 可并行 + 精确联想召回 [$S \leftarrow S - \beta(S\cdot k)k^{\top}$ 再写 v]
问题 线性 transformer 在 in-context 召回上输给 softmax,且 delta 规则训不动;方法 用 delta 规则更新 state(先减去 key 的旧关联、再写新 value),并给出 WY 表示让它在序列长度上可并行;核心 把「联想召回」带进线性注意力,是 delta 家族的起点。
Gated DeltaNet(Gated Delta Networks: Improving Mamba2 with Delta Rule)(2412.06464,Yang, Kautz, Hatamizadeh,NVIDIA,ICLR 2025)
linear(gdelta) -> 快遗忘 + 精准编辑 [标量门控 × delta 规则]
问题 门控(快速擦除)和 delta(精准更新)是两件互补的事,此前没人合起来;方法 提出 gated delta rule:一个标量门控同时控制遗忘量和写入量,并配硬件友好的并行训练;核心 超过 Mamba2 和 DeltaNet,成为 Qwen3-Next 的线性主干——这是用户点名的新架构,也是线性注意力「召回追上 softmax」的转折。
Gated DeltaNet-2(Decoupling Erase and Write)(2605.22791,Hatamizadeh, Choi, Kautz 2026)
linear(gdelta2) -> 分离擦除/写入 [通道级 erase 门 b_t + write 门 w_t]
问题 Gated DeltaNet 和 KDA 用同一个标量门控控制「删多少旧」和「写多少新」两件不同的事;方法 拆成通道级的 erase 门和 write 门,各管各的轴;核心 同时推广 Gated DeltaNet 与 KDA,是 Mamba-2 系谱里最强的 delta 变体。
Comba(Bilinear RNNs with Closed-loop Control)(2506.02475,2025)
linear(bilinear RNN) -> 闭环控制更新 [scalar-plus-low-rank 门控]
问题 Gated DeltaNet / TTT / RWKV-7 都引入 state 和 key 的交互(双线性),但各做各的、缺统一视角;方法 提出「双线性 RNN」统一概念,用闭环控制理论设计 Comba(标量 + 低秩门控);核心 把 delta 家族抽象成控制系统,给出可训练的稳定更新。
Kaczmarz Linear Attention(KLA)(2605.08587,2026)
linear(kaczmarz) -> 一标量改动 GDN [Kaczmarz 投影更新]
问题 Gated DeltaNet 的标量门控在删旧/写新之间权衡不够细;方法 用 Kaczmarz 投影做 state 更新,只改一个标量,保留 state 形状、门控、递归和分块并行;核心 最小改动换来更细的 state 维护,说明 delta 家族还有微调空间。
HOLA(A Hippocampus for Linear Attention)(2607.02303,2026)
linear + 精确 KV 补丁 -> 补回被遗忘的精确记忆 [互补学习系统]
问题 线性注意力把前缀压进定长 state,事实一多就互相覆盖、needle 召回掉;方法 受「互补学习系统」启发,给每层线性注意力配一个「海马体」——保留一小撮精确 KV,专门兜住被 state 忘掉的关键绑定;核心 线性注意力的「精确记忆」补丁,直接治 recall 掉点。
KDA / Kimi Linear(2510.26692,Kimi Team 2025)
linear(gdelta + 细粒度门控) -> 首超 full attention [DPLR 分块算法]
问题 线性注意力在公平比较下仍难超过 full attention;方法 KDA 给 Gated DeltaNet 加更细粒度门控,用专用 DPLR 分块算法提升硬件效率;核心 3B 激活/48B 总参、KDA+MLA 混合,公平比较下超过 full MLA,KV 省 75%、1M 解码吞吐 6x。
DeltaProduct(Householder Products)(2502.10297,Siems et al. 2025,NeurIPS 2025)
linear(多步 Householder 更新) -> 状态追踪强 + 外推好 [diagonal+rank-n]
问题 DeltaNet 每 token 只做一步在线梯度下降、状态追踪有限;方法 每 token 做 $n_h$ 步,得到对角+rank-$n_h$ 转移矩阵(广义 Householder 乘积);核心 状态追踪和长度外推都超 DeltaNet。
PGDN / PKDA(Preconditioned DeltaNet)(2604.21100,Tumma et al. 2026)
linear(预条件 delta) -> 召回提升 [曲率对角近似]
问题 delta 递推是 online least squares 的一阶近似、忽略曲率;方法 用对角预条件给 DeltaNet / GDN / KDA 加曲率感知;核心 340M/1B 上召回和语言建模一致提升,给出 GDN 家族的预条件版本。
PaTH Attention(Position via Householder)(2505.16381,Yang et al. 2025,NeurIPS 2025)
attn(数据依赖位置编码) -> 表达力超 RoPE [累计 Householder 乘积]
问题 RoPE 只依赖相对位置、与输入无关;方法 用累计 Householder 变换做数据依赖的位置编码,并行训练 + FlashAttention 式分块;核心 可把预训练 RoPE 模型续训转成 PaTH,是「位置编码即门控」路线。
FoX(Forgetting Transformer)(2503.02130,Lin et al. 2025,ICLR 2025)
attn(softmax + 遗忘门) -> 长上下文 + 外推 [数据依赖下加权]
问题 Transformer 缺显式遗忘门;方法 用数据依赖方式下加权未归一化注意力分数,给 softmax 加遗忘门;核心 长上下文/外推超 Transformer,兼容 FlashAttention、无需位置编码。
Wall Attention(Diagonal Gates)(Tilde 博客,2026)
attn(对角门位置编码) -> 长度泛化强 [逐通道遗忘]
问题 对角门控在 softmax 的无穷维特征空间怎么落地;方法 用 induced action 框架把线性 RNN 的对角门搬到 softmax,每个通道独立遗忘;核心 可替代 RoPE、兼容 GQA/MLA,把 FoX / PaTH / Wall 统一为特例。
DeltaFormer(Associative Memory 视角)(2505.19488,Zhong et al. 2025)
analysis(联想记忆) -> Transformer 统一理解 [retrieval SNR + 记忆更新]
问题 Transformer 的记忆机制本质是什么;方法 用联想记忆视角统一 softmax 注意力、线性注意力和 DeltaNet 的更新规则;核心 提出 retrieval SNR 和记忆更新框架,是 fla 里 DeltaFormer 的理论底座。
Log-Linear Attention(2506.04761,Guo et al. 2025)
linear(对数增长 state) -> 平衡效率与表达 [多组 hidden state]
问题 线性注意力定长 state 是根本瓶颈;方法 用对数增长的 hidden state 集合替换定长 state,保持 matmul 友好并行;核心 通用框架,可给 Mamba-2 / GDN 加 log-linear 版本。
MoM(Mixture-of-Memories)(2502.13685,Du et al. 2025)
linear(多记忆路由) -> 召回强 [router 分配 token 到独立 state]
问题 单一 state 压缩全序列、召回差;方法 多个独立记忆 state + 路由网络把 token 分配到特定记忆,减少干扰;核心 召回密集任务超已有线性模型、接近 Transformer,训练仍线性。
Raven(Sparse Memory Routing)(goombalab,2026)
linear(稀疏记忆路由) -> 高召回 + 次平方 [top-k slot 更新]
问题 SSM 稠密更新全 state、SWA 强制 FIFO 覆盖;方法 输入依赖的稀疏路由只更新 top-k 记忆槽,未选槽不动、防干扰;核心 线性时间 + 强联想召回,built on fla。
6. Test-time learning 作为架构(TTT → Titans)
另一条让 state「更会记」的路:干脆把 hidden state 本身做成一个机器学习模型,每次更新就是一步 self-supervised 学习。TTT 证明 TTT-Linear 等价于线性注意力、TTT-MLP 更强;Titans 再往前走一步,给注意力配一个「按惊讶度」决定记什么、怎么记的神经长期记忆。
Test-Time Training(Self-Supervision for Distribution Shift)(1909.13231,Sun et al. 2020)
ttt(自监督) -> 测试时自适应 [旋转预测辅助任务]
问题 测试分布和训练分布漂移、模型不能现场适应;方法 测试时用自监督辅助任务(如预测旋转角)继续更新模型参数;核心 「测试时还要学习」这个思想的源头,后被搬到架构里(TTT-2024)。
TTT(Learning to (Learn at Test Time): RNNs with Expressive Hidden States)(2407.04620,Sun et al. 2024)
ttt -> 线性复杂度 + 表达力强的 hidden state [state = ML 模型,更新 = 自监督一步]
问题 RNN 线性复杂度但 hidden state 表达力弱、长上下文不行;方法 把 hidden state 做成一个 ML 模型,更新规则 = 一步 self-supervised learning;核心 TTT-Linear 等价于线性注意力,TTT-MLP 用两层 MLP 当 state、表达力更强,是「测试时学习」进架构的标志。
Titans(Learning to Memorize at Test Time)(2501.00663,Behrouz et al. 2025,Google)
dense + mem -> 注意力 + 神经长期记忆 [按惊讶度记 / 忘]
问题 RNN 压缩丢信息、注意力精确但 $O(n^2)$ 且有上下文上限;方法 给注意力配一个「神经长期记忆」,作为 meta in-context learner 在测试时继续学、按惊讶度决定记什么;核心 把「记忆」从注意力里拆出来变成一等模块,长短结合,是 TTT 思想到记忆架构的落地。
MesaNet(Locally Optimal Test-Time Training)(2506.05233,von Oswald et al. 2025,ICLR 2026)
ttt(局部最优测试时训练) -> 长上下文强 [CG 求解 + 分块并行]
问题 线性 RNN 的 in-context 更新只是近似在线学习;方法 每步用共轭梯度把 in-context 回归求到最优,并做数值稳定分块并行;核心 1B 规模长上下文更强,代价是推理多花 flops。
7. 新一代旗舰(混合架构:线性压缩 + 注意力检索)
2025 之后的最大共识:别二选一,混合。线性/SSM 层便宜、管长程压缩;全注意力或稀疏层贵、管精确召回;按 3:1 或 5:1 交错。Qwen3-Next、Kimi K2/K3、MiniMax M2、Ling-3.0-flash 等旗舰都这么干;此外「低秩 KV 压缩」(MLA / MFA)是注意力检索侧的省内存技巧,也一并收在这里。
Hymba(Hybrid-head Architecture)(2411.13676,NVIDIA 2024)
hybrid(attention head + SSM head) -> 小模型效率 [并行双头 + meta token]
问题 注意力头精确但贵、SSM 头便宜但粗,小模型里怎么都要;方法 同一个 block 里并行放注意力头和 SSM 头,外加可学习的 meta token 存关键信息;核心 混合头的早期代表,小模型里注意力和 SSM 互补。
Qwen3-Next(Gated Attention + Gated DeltaNet 混合)(2505.06708 + Qwen 模型卡,2025)
hybrid(gdelta : gated-attn = 3:1) -> 262K~1M 上下文 + 省算力 [线性主干 + 全注意力 + 稀疏 MoE]
问题 大参数 + 超长上下文 + 省算力三者怎么同时要;方法 3 层 Gated DeltaNet 线性层配 1 层 Gated Attention 全注意力层(后者 sink-free、带 QK-Norm),MLP 用稀疏 MoE;核心 第一个接近旗舰的混合注意力开源模型,把「线性做长程、注意力做精确」坐实,也是用户点名的「Qwen next」。
Kimi K2(Open Agentic Intelligence)(2507.20534,Moonshot 2025)
hybrid(KDA 线性 + 注意力) -> 1T 参数 agentic 模型 [MuonClip 优化器 / 15.5T token 零尖峰]
问题 大规模预训练训练不稳、优化器 token 效率低;方法 提出 MuonClip(Muon + QK-clip)抑制尖峰,15.5T token 零 loss spike;核心 KDA(Kimi Delta Attention)首次落地的开放 agentic 旗舰,K3 的地基。
Kimi K3(Open Frontier Intelligence)(2607.24653,Moonshot 2026)
hybrid(KDA 线性 + Gated MLA) -> 1M 上下文 + 2.5× 扩展效率 [Attention Residuals + Stable LatentMoE]
问题 怎么在 K2 之上把扩展效率再抬一大截、并支持原生视觉 + 1M 上下文;方法 2.8T 总参 / 104B 激活的 MoE,Kimi Delta Attention(门控 delta 规则线性层)与 Gated MLA(潜注意力)按 3:1 交错,新增「Attention Residuals」改善跨深度信息流、Stable LatentMoE 稳定激活 16/896 专家;核心 用户点名的旗舰:KDA 线性 + 注意力混合 + 训练/数据配方,整体扩展效率比 K2 高约 2.5 倍。
MiniMax M2 系列(2605.26494,MiniMax 2026)
MoE(229.9B/9.8B) -> agentic 前沿 [agent 数据 + Forge RL + 自进化]
问题 小激活(mini activation)能不能释放真实世界智能、并端到端服务 agentic 任务;方法 229.9B 总参 / 9.8B 激活,三件套:agent 驱动的可验证轨迹数据、Forge 长程 RL 系统、M2.7 起步的自进化;核心 报告重心在 MoE + agentic RL 与自进化,注意力架构未在摘要展开(MiniMax 的线性注意力底座是 Lightning Attention-2,见 §3)。
Ling-3.0-flash(Ant 百灵)(官方博客,2026)
hybrid(KDA : MLA = 5:1) -> 124B/5.1B + 256K→1M [细粒度对角门控 KDA + 1/64 MoE]
问题 如何在极低激活下对标上一代 1T 级旗舰;方法 预训练起就用原生混合线性注意力,每 6 层 = 5 层 KDA + 1 层 MLA;KDA 用细粒度对角门控给不同通道独立的保留/衰减/写入控制,稀疏 MoE 每个 token 只激活 1/64 专家;核心 124B 总参 / 5.1B 激活,原生 256K、可扩 1M,「KDA + MLA」混合线性注意力在蚂蚁系旗舰落地。
MFA(Multi-matrix Factorization Attention)(2412.19255,StepFun 2024)
low-rank(QK 多矩阵分解) -> KV -56% vs MLA / -93.7% vs MHA [MFA-KR key 复用]
问题 严格 KV 预算下 MLA 等现有变体掉性能;方法 在 QK 回路做低秩多矩阵分解,放大注意力头的数量与维度;MFA-KR 再把 key 缓存重参数化复用作 value;核心 超 MLA、比肩 MHA,同时 KV 缓存分别省 56% / 93.7%,是 Step-3 的注意力内核(低秩 KV,非 $O(n)$ 线性)。
Step-3(Large yet Affordable)(2507.19427,StepFun 2025)
low-rank(MFA) + AFD -> 低解码成本 [注意力/FFN 分离 + 38B 激活]
问题 大模型解码硬件效率低、长上下文推理成本高;方法 用 MFA 低秩压缩 KV,并把注意力与 FFN 拆成两个专用子系统(AFD)做分布式推理;核心 321B VLM、38B 激活,Hopper 上解码吞吐超 DeepSeek-V3,是低秩 KV + 系统协同设计的效率路线。
SSE(Sparse State Expansion,ByteDance Seed)(2507.16577,2025)
linear(行稀疏更新 + state 分区) -> 更强召回 + 更省参数 [top-k 硬分类 + SSE]
问题 线性注意力把上下文压进定长 state,in-context 检索和推理掉性能;方法 把 state 更新看作信息分类,用 softmax top-k 硬分类做行稀疏更新;再提出 SSE 把 state 扩成多个分区,解耦参数规模与 state 容量;核心 纯线性与混合 SSE-H 都有效,2B SSE-H 经 RL 后 AIME24 64.5 / AIME25 50.2,是字节跳动 Seed 的线性注意力路线。
YOCO(You Only Cache Once)(2405.05254,Sun et al. 2024)
decoder-decoder(只缓存一次) -> 省 KV + 1M 上下文 [self-decoder + cross-decoder]
问题 KV 缓存和预填充是长序列瓶颈;方法 自解码器编码全局 KV,交叉解码器复用,整体只缓存一次;核心 1M 上下文近乎完美 needle 检索,推理内存/延迟/吞吐改善明显。
Samba(Hybrid Mamba + SWA)(2406.07522,Ren et al. 2024,ICLR 2025)
hybrid(Mamba + SWA) -> 近无限上下文 [层间混合 SSM/滑窗]
问题 长上下文要 SSM 的压缩 + 精确近期召回;方法 每层混合 Mamba 与滑动窗口注意力;核心 3.8B/3.2T,4K 预训练零样本外推到 1M,Passkey 256K 完美召回。
Rodimus*(DDTS + SW-SKA 混合)(2410.06577,He et al. 2024,ICLR 2025)
hybrid(linear DDTS + SW-SKA) -> 精度效率平衡 [tempered selection + 共享 key 滑窗]
问题 线性注意力精度掉、经典注意力贵;方法 数据依赖 tempered selection 线性注意力 + 滑动窗口共享 key 注意力混合;核心 1.6B/1T token 超过 Qwen2-1.5B、RWKV6-1.6B。
8. 训练数据与 Benchmark(单独一节)
子平方架构能不能训起来、训完到底「真长」还是「假长」,是另一条独立的线:用什么数据/优化器训(K2 的 MuonClip、M2 的 agent 数据),以及用什么 benchmark 照出 recall / 真实上下文长度。
8.1 训练侧
MuonClip(Kimi K2 的优化器)(见 2507.20534)
optimizer(Muon + QK-clip) -> 训练稳定 + token 高效 [clip 抑制尖峰]
问题 大模型预训练 loss 尖峰、Muon 不稳;方法 给 Muon 加 QK-clip;核心 15.5T token 零尖峰,是大规模训子平方模型的关键工程件。
Agent 驱动数据 + Forge RL(MiniMax M2)(见 2605.26494)
data(可执行轨迹) + RL(长程 agent) -> 可验证训练信号 [artifact 对齐奖励]
问题 agentic 模型缺大规模可验证训练轨迹、RL 扛不住长程;方法 agent 数据管道(编码/协同,落在可执行 workspace)+ Forge 长程 RL;核心 说明 2025-2026 旗舰的竞争重心正从「架构」转向「数据 + RL」。
8.2 Benchmark
LongBench(2308.14508)
benchmark(双语多任务) -> 长上下文理解 [6 类 21 任务]
问题 缺系统长上下文理解评测;方法 中英双语单/多文档、检索、摘要、代码、合成;核心 最常用的长上下文理解基准。
RULER(2404.06654)
benchmark(合成检索) -> 真实上下文长度 [变体 needle-in-haystack]
问题 「宣称 128K」≠「真能用到 128K」;方法 合成检索测有效上下文长度;核心 照妖镜,尤其线性注意力 recall 掉点在这里现形。
∞Bench(InfiniteBench)(2402.13718)
benchmark(100K+) -> 极长上下文 [检索/推理/长链]
问题 需要 100K+ 真实任务评测;方法 构造 100K 以上检索、推理、长链依赖;核心 极长上下文的压力测试。
LongBench v2(2412.15204)
benchmark(真实难任务) -> 深度长上下文推理 [更难、需推理而非检索]
问题 v1 偏检索、短模型也能蒙对;方法 用「检索不够、要真推理」的真实难任务;核心 区分「找得到」和「想得清」,旗舰主打的深度长上下文评测。
9. 共识与分歧(速记版)
共识:
- softmax 注意力是「精确但 $O(n^2)$」,线性/SSM 是「便宜但定长 state 有 recall 上限」,两者不能互相替代。
- delta 规则 + 门控(Gated DeltaNet / KDA / Gated DeltaNet-2)是目前线性注意力「召回」最接近 softmax 的一支。
- 混合是旗舰的答案:Qwen3-Next、Kimi K2/K3、Ling-3.0-flash 都按「线性层 + 注意力层」交错,线性管长程、注意力管精确召回。
- 2025-2026 竞争重心从「纯架构」转向「数据 + RL + 扩展效率」(K2 的 MuonClip、M2 的 Forge、K3 的 2.5× 扩展效率)。
分歧 / 难点:
- state 更新规则还没收敛:叠加(线性注意力)→ 门控(GLA)→ delta(DeltaNet)→ 门控 delta(Gated DeltaNet)→ 分离擦除/写入(GDN-2)→ 双线性闭环(Comba)→ Kaczmarz(KLA),每篇都在改更新规则,说明「最优更新」未定。
- 精确 recall 的兜底方式:是用混合全注意力(Qwen/Kimi),还是给线性层挂精确 KV 补丁(HOLA),还是干脆学出来的稀疏(HiLS/Seer,见 sparse-attention.html)——三条路并存。
- 哪个子平方架构最强没定论:综述(2606.12364)在代码/时序上给了 xLSTM,但语言建模 + 长上下文上 Gated DeltaNet 家族占优,任务依赖强。
- 线性 vs 注意力谁主谁辅:线性压缩上限是定长 state 的表达力,注意力(含稀疏)保留精确但更贵,二者在旗舰里的配比(3:1?)多是经验值,缺统一理论。
- 评测:RULER 这类合成检索能照出 recall 掉点,但真实 agentic/推理任务(LongBench v2)里架构差异变小,架构收益难和「数据/RL」收益分开归因。
说明:种子与点名论文(Gated DeltaNet 2412.06464、Kimi K3 2607.24653、Qwen3-Next/Gated Attention 2505.06708、Titans 2501.00663、TTT 2407.04620、MiniMax M2 2605.26494)已读摘要/方法;所有 arXiv 号已逐一核对。RWKV-4/5/6/7、KDA、DeltaProduct、PGDN/PKDA、PaTH、FoX、Wall、DeltaFormer、Log-Linear、MoM、Raven、MesaNet、HGRN2、Rebased、LightNet、GSA、ABC、Mamba-3、Samba、YOCO、Rodimus* 均按 fla 仓库的算法清单补齐并读摘要核实(Raven/Wall 无 arXiv,取自仓库/博客)。Ling-3.0-flash 信息来自官方博客;MFA / Step-3 属低秩 KV 压缩($O(n^2)$ 注意力、非 $O(n)$ 线性),与 MLA 同族,放这里是因同属「注意力效率」谱系;MiniMax M2 报告摘要未展开注意力架构,已按此修订。ByteDance Seed 的 SSE 属「线性注意力 + 稀疏 state 扩展」研究路线;Qwen3.5 延续 hybrid linear/full,公开技术报告细节有限,未单独成条。稀疏注意力单独成篇:sparse-attention.html;长上下文整体脉络见 long-context.html。「test-time training」在此按架构(TTT/Titans)并入;经典 continual learning 是另一主题。