
那聪明的你一定想问,“总参数”和“激活参数”到底是什么关系?284B 和 13B 差了 20 多倍,剩下的参数在干嘛?
答案直接告诉你,MoE(Mixture-of-Experts)——也就是混合专家架构。
我翻了 DeepSeek V4 的技术报告和 DeepSeekMoE 的原始论文,可以自信地、大方地、光明磊落地帮你搞清楚三件事:
- MoE 到底是什么,为什么不需要所有参数同时工作?
- 模型怎么知道该派哪些专家来处理当前的内容?
- MoE 对我们用模型有什么实际影响?

哈喽大家好,我是二哥呀。今天用 3 分钟,给你讲清楚什么是 MoE,以后给朋友们装杯也是不错的,就你懂,妥妥的全场就你最聪明(😄。
系好安全带,我们粗粗粗出发了~
先说第一件事,MoE 到底是什么。
为了搞清楚,我们还需要搞清楚一个前提。大模型(Transformer)的每一层都有两个核心模块:注意力层(Attention)负责理解上下文关系,前馈网络(FFN)负责处理和变换信息。
注意力层是稠密(Dense)的,也就是说,不管是哪个 Token,都要经过完整的注意力层计算。
MoE 把原本一整块的前馈网络,拆成了 256 个小型的“路由专家”(Routed Expert)和 1 个“共享专家”(Shared Expert)。
打个比方。一家医院有 256 位专科医生和 1 位全科医生。病人来了,不可能 257 个医生一起上——那不叫会诊,那叫浪费人力。
导诊台护士会根据你的症状,挑 6 位最对口的专科医生。胳膊错位的找骨科,嗓子不舒服的找耳鼻喉。

所有的 token 共享专家都会瞅一眼,主要负责语法、常识这类通用知识。
然后由路由器(Router)按 Top-K 策略挑出 6 个路由专家和共享专家一起干活,正所谓术业有专攻——有的擅长写代码,有的擅长做数学题,有的擅长写文本。
V4 Flash 一共有 43 层(Layer),每层都是这样一个结构——256 个路由专家 + 1 个共享专家。所以每个 token 每层只激活 7 个专家(6+1)。
那聪明的你肯定想问:13B 和 284B 到底怎么来的?
先说公式。
激活参数 = 注意力层参数 + 每层激活的专家数量 × 每个专家的参数 × 层数。
总参数 = 注意力层参数 + 每层的专家数量× 每个专家的参数 × 层数。
区别只有一个——“激活的专家数量”和“全部的专家数量”。
V4 Flash 是 43 层,每层 257 个专家(256+1),每个专家约 2500 万参数(别问我怎么知道的,4096 × 2048 × 3),每个 token 只激活 7 个(6+1)。
激活参数:7 × 2500 万 × 43 层 ≈ 75 亿,加上注意力层等固定开销约 55 亿,合计约 130 亿——就是 13B。
总参数:257 × 2500 万 × 43 层 ≈ 2760 亿,加上固定开销,就是 284B。
激活比例 7 比 257,不到 3%。
剩下的参数不是闲着,是还没轮到。下一个 token 进来,可能就是另外 6 个上场了。
那聪明的你肯定想到了:模型怎么知道该叫哪 6 个专家?
靠路由器(Router)。就是医院里那个导诊台。
路由器是一个专门训练过的打分网络。每个 token 进来,它给 256 个路由专家各打一个分,然后用 Top-K 策略挑出分数最高的 K 个——V4 Flash 的 K 是 6。

路由器不是写死的规则,是在训练出来的。模型训练得越久,路由器就越聪明,知道“这类问题该找谁”。
那聪明的你肯定又要问了:这对我们选模型有什么参考价值?
两个字:省钱。
MoE 的好处是,训练的时候用 284B 参数学知识,覆盖面广;推理的时候只有 13B 的计算量,速度快成本低。
Agent 场景下这个优势更明显——一个任务动不动就是几十上百次模型调用,每次调用省一点,累积下来就是几倍甚至十几倍的成本差距。
所以你看,2026 年排名前 10 的最强开源模型,全部用的是 MoE。
最后简单总结下。
MoE 说人话就是“不用所有专家都同时上班”。256 个专家代表模型的知识总量,但每个问题只需要最懂这事的 6 个来回答。
另外,以后看模型参数,别只看总参数——284B 听着很唬人,真正决定推理速度和成本的是激活参数。
这个知识点你学废了吗?想解锁更多 AI 硬核知识,点赞关注,我是二哥,咱们下期见!



