可解释性 · Sparse Autoencoders vs SAEs vs GemmaScope
稀疏自编码器原理解读:把叠加的神经元拆成可读的特征
语言模型的一个神经元可能同时对法语、DNA 和 HTTP 放电。稀疏自编码器把这种叠加拆回单一语义的特征,GemmaScope 又用 400+ 个开放 SAE 覆盖 Gemma 2 全部层。
对比
基于原论文的架构与方法解读,带关键数字。
可解释性 · Sparse Autoencoders vs SAEs vs GemmaScope
语言模型的一个神经元可能同时对法语、DNA 和 HTTP 放电。稀疏自编码器把这种叠加拆回单一语义的特征,GemmaScope 又用 400+ 个开放 SAE 覆盖 Gemma 2 全部层。
专家混合 · Mixture of Experts vs Switch Transformer vs Mixtral vs DeepSeek-V3
把每层一个前馈网络换成许多专家和路由器,每个 token 只激活少数专家:参数总量和每 token 算力就此脱钩。Switch、Mixtral、DeepSeek-V3 三代设计一次讲清。
微调与适配 · on-policy distillation vs OPD vs knowledge distillation
On-policy distillation 让学生在自己的轨迹上向老师学习。五篇 2026 论文讲清如何稳住它、砍到 5% token,并用于投机解码与文生图。
语言模型 · DeepSeek V4
DeepSeek V4 保留 V3 的 MoE,把注意力改为先压缩再稀疏,在双随机约束下加宽残差流,用 Muon 训练大多数矩阵;1M 下 KV 缓存只有 V3.2 的 10%。
语言模型 · Kimi K3
Kimi K3 三层 delta 规则线性注意力配一层全局 MLA,深度上对前置层做注意力,经半宽潜变量路由到 896 选 16 的专家;缩放效率约为 K2 的 2.5 倍。
长上下文 · KV cache compression
长上下文里耗尽显存的是 KV 缓存而非权重。2026 年四条路线:撑过长解码的 2 比特量化、13.5% 常驻的前瞻卸载、1:16 软 token 压缩、固定大小记忆。
语言模型 · Nemotron 3
Nemotron 3 Ultra 大多数层是 Mamba-2,注意力只有 2 个 KV 头,经潜变量路由到 512 选 22 的专家;解码比 GLM-5.1 快最多 5.9 倍。
语言模型 · Qwen3.8-Next
Qwen3.8-Flash-Next 激活 6B 参数;3:1 GDN 混合、稀疏注意力、门控残差和 Muon 以 1/9 FLOPs 追平 Qwen3.7-Plus。
高效 AI · Speculative decoding
小模型先猜几个 token,大模型一次前向验证,拒绝采样保证输出分布不变。整场游戏就是有多少草稿 token 能活下来,2026 年的收益来自训练和重构草稿模型,而不是目标模型。