注意力计算量在所有同级模型里最低,不仅低于 DeepSeek V4-Flash,也低于 Kimi-K3。
那聪明的你一定想问,为什么 GLM-5.3-Flash 能如此低价?
因为 GLM-5.3-Flash 为降低模型在长上下文场景下的注意力成本,采用了线性注意力和稀疏注意力相结合的混合架构。

那聪明的你肯定要问,这套混合架构到底是啥?
我翻了 GLM 的技术报告和官方技术博客,可以自信地、大方地、光明磊落地帮你搞清楚三件事:
- 线性注意力为什么能把计算量从
(读:欧 n 的平方) 降低到 (读:欧 n)呢? - 计算变快了会牺牲什么呢?
- 混合架构又是怎么把牺牲的部分补回来的?

哈喽大家好,我是二哥呀。今天用 3 分钟,给你讲清楚什么是线性注意力,以及 GLM-5.3-Flash 为什么要把它和稀疏注意力混着用。
系好安全带,我们粗粗出发了~
线性注意力:O(n²) 降到 O(n)
先说第一件事,线性注意力为什么能把计算量从 O(n²) 降低到 O(n)。
标准注意力做的事,是让每个 token 回头把其他所有 token 都看一遍,判断谁跟自己最相关,再按相关程度把大家的信息混合起来。
用公式写出来就是 Q 乘以 K 的转置,再乘以 V。

- Q(Query,查询)——你正在找的东西;
- K(Key,键)——每个 token 身上挂的标签;
- V(Value,值)——每个 token 真正的内容。
Q 乘以 K 的转置,说白了就是【拿查询去和每个标签对一遍,算两两之间的相关分数】。点积结果越大,说明两个 token 越相关。
再乘以 V,就是【按相关度加权混合内容】。跟查询越相关的 token,它的内容在结果里占的比重越高。
标准注意力的瓶颈就在第一步。Q 乘以 K 的转置会生成一个 N×N 的矩阵,N 是序列里 token 的数量。这个矩阵记录了任意两个 token 之间的相关性分数。100 万个 token,就是一万亿个分数。也就是 O(n²) 计算量的来源。
而且这一步没法跳过。因为接下来的 softmax 归一化要求同一行的所有分数必须一起算完,才能做归一化。

PS:softmax 就是把一行分数变成加起来等于 1 的权重,归一化之前得先知道这一行的总和,所以一行分数必须全部算完。
线性注意力的核心就是去掉 softmax。
去掉之后,Q、K、V 三个矩阵的乘法就变成了纯粹的矩阵连乘。纯矩阵连乘有一个关键性质——结合律,说白了就是,三个数相乘,先算哪两个,结果都一样。2×3×4,先算 2×3 再乘 4 得 24,先算 3×4 再乘 2 还是 24。

既然结果一样,那我们就有了主动权——挑一个中间矩阵最小的顺序去算。
原来的顺序是先算 Q 乘以 K 的转置,得到 N×N 的大矩阵,再乘以 V。
现在换个顺序是,先算 K 的转置乘以 V,得到一个 d×d 的小矩阵,再用 Q 去乘它。
d 是每个注意力头的维度,通常是 64 或者 128。而 N 是序列长度,通常可以达到百万级别。一个 128×128 的矩阵和一个 100万×100万 的矩阵,计算量差了好几个数量级。
打个比方。假设一个班有 50 个同学。标准注意力是让每个同学都跟其他 49 个同学挨个单独聊一遍、交换信息,两两之间都要碰一次,所以总次数接近 50×50 这个量级,也就是 n²。而线性注意力是把所有同学的信息先写到全班共用的一块黑板上,然后每个同学去黑板前看一遍就全拿到了。每个人只写一次、看一次,总共也就 100 次左右,是 n 的量级。
代价:序列开头的内容记不清
那聪明的你肯定想到了:去掉 softmax,换了计算顺序,速度快了,代价是什么?
代价是对序列开头的内容,开始记不清了。
为什么?因为线性注意力在推理时,等价于一个 RNN——也就是循环神经网络。它维护了一个固定大小的状态矩阵 S,维度是 d×d。每来一个新 token,就把这个 token 的 key 和 value 加进 S 里。

由于 S 的大小固定,不会随序列变长而变大,所以塞了 100 万个 token 的这个矩阵里,越靠前的 token,越容易被后面新来的覆盖,或者掩盖。
结果就是线性注意力擅长记住「近处的信息」;但在远处的,也就是序列一开头的就容易记不清楚。
混合架构:稀疏注意力管远处
那怎么办?
答案是混合架构,线性注意力管近处,稀疏注意力管远处。
GLM-5.3-Flash 一共 45 层。大部分层用线性注意力,负责处理近距离的上下文依赖,快,而且省钱。每隔几层,插一层稀疏注意力(DSA),专门负责远距离的精确检索。

DSA 里有一个轻量级的索引器,你可以把它理解成一本书的目录。不用翻完整本书,先扫一眼目录,定位到最相关的几页,再精读。
具体的做法是给所有历史 token 快速打分,只挑最相关的来做注意力计算,其余的跳过。
为了进一步省内存,GLM-5.3-Flash 还引入了 IndexPool:相邻几层的索引器会选出高度重叠的 token,把 4 层索引器的 key 向量通过加权求和压缩成 1 个向量,能节省大约四分之三的索引器缓存。
效果怎么样?
和 GLM-5.3 相比,注意力计算量降为原来的 1/3,KV Cache 降到原来的约 1/4。
一句话总结
最后简单总结下。
GLM-5.3-Flash 把注意力的计算量从 O(n²) 降低到了 O(n) ,通过线性注意力加少量稀疏注意力兜底远程检索,让百万上下文的推理成本降了下来,成为了新的斩杀线。
这个知识点你学废了吗?想解锁更多 AI 硬核知识,点赞关注,我是二哥,咱们下期见!



