长上下文 · Kimi K3 vs DeepSeek V4 vs Qwen3.8-Next vs Nemotron 3 Ultra
Kimi K3、DeepSeek V4、Qwen3.8-Next 架构对比
四家 2026 前沿开源模型各用各的法子撑 1M 上下文:K3 用 Delta 注意力,V4 压缩 KV,Qwen 用 GDN,Nemotron 靠 Mamba-2 换吞吐。
主题
面向超长文本、音频、视频或代码上下文的模型与评测。
长上下文 · Kimi K3 vs DeepSeek V4 vs Qwen3.8-Next vs Nemotron 3 Ultra
四家 2026 前沿开源模型各用各的法子撑 1M 上下文:K3 用 Delta 注意力,V4 压缩 KV,Qwen 用 GDN,Nemotron 靠 Mamba-2 换吞吐。
多模态模型 · Keye-VL 2.0 vs InternVideo3
Keye-VL 2.0 走稀疏注意力长上下文路线(LongVideoBench 74.1);InternVideo3 用 80 亿小模型加智能体回路(Video-MME +2.7)。
语言模型 · DeepSeek V4
DeepSeek V4 保留 V3 的 MoE,把注意力改为先压缩再稀疏,在双随机约束下加宽残差流,用 Muon 训练大多数矩阵;1M 下 KV 缓存只有 V3.2 的 10%。
语言模型 · Kimi K3
Kimi K3 三层 delta 规则线性注意力配一层全局 MLA,深度上对前置层做注意力,经半宽潜变量路由到 896 选 16 的专家;缩放效率约为 K2 的 2.5 倍。
长上下文 · KV cache compression
长上下文里耗尽显存的是 KV 缓存而非权重。2026 年四条路线:撑过长解码的 2 比特量化、13.5% 常驻的前瞻卸载、1:16 软 token 压缩、固定大小记忆。
序列建模 · Mamba vs Transformer
Mamba 用固定大小的选择性状态换掉注意力的平方计算和 KV 缓存:解码吞吐 5 倍、3B 上打平两倍大的 Transformer,但精确回忆仍属于注意力。
语言模型 · Qwen3.8-Next
Qwen3.8-Flash-Next 激活 6B 参数;3:1 GDN 混合、稀疏注意力、门控残差和 Muon 以 1/9 FLOPs 追平 Qwen3.7-Plus。
长上下文 · Sparse attention vs Full attention
稀疏注意力在 100 万 token 上把注意力计算量压到 1/7 到 1/28,长上下文基准只掉半分左右;但实际耗时的收益远小于 FLOPs 的收益,32K 以下几乎看不见。
DeepSeek-V4 发布 1.6T/49B 和 284B/13B 两个 MoE,用压缩稀疏与重度压缩注意力把 1M 上下文的 KV 缓存降到 V3.2 的 10%。
Kimi K3 是 2.8T 参数、104B 激活的 MoE,由 3:1 的 KDA 与门控 MLA、注意力残差和 896 专家 LatentMoE 构成,缩放效率为 K2 的 2.5 倍。
Qwen3.8-Flash-Next 是 125B 参数、6B 激活的 MoE;GDN 混合、稀疏注意力、门控残差和 Muon 让它以 1/9 FLOPs 追平 Qwen3.7-Plus。
CARVE 给每个视频块单独选模态-粒度配置,而不是按查询统一定一种,在去泄漏的 V-RAGBench 上把 Recall@5 从最强基线的 0.510 提到 0.603。
MemDreamer 把长视频问答变成在三层图记忆上的智能体检索,LVBench 从 78.2 升到 90.7(+12.5),推理只读约 6K token,不是 24 万到 78 万。
LCLM 把 0.6B 编码器和 4B 解码器联合训练,把长上下文压成软 token,支持 1:4、1:8、1:16,显著降低预填充显存和首 token 延迟,精度接近未压缩基线。
智能体记忆 · National University of Singapore
EvoArena 把静态智能体任务改造成演化链,当前智能体平均准确率只有 39.6%;EvoMem 用 patch memory 将链级准确率提高 3.7 点。
Kwai Keye-VL-2.0 是 30B-A3B 开放 MoE 多模态模型,支持 256K 上下文,在长视频、时间定位和代码智能体任务上表现突出。
MSA 让每个查询组只看 2048 个被选中的 KV token,在 1M 上下文报告 28.4 倍注意力 FLOPs 降低、14.2 倍 prefill 加速。
清华 LongTraceRL 从搜索智能体轨迹挖更难的干扰文档,再加实体级 rubric 奖励,让 Qwen3-4B 五个长上下文基准平均分从 53.3 涨到 59.0。
AI 智能体 · Independent Researcher
搜索智能体何时该屏蔽旧观察把搜索智能体上下文管理变成可检查任务,帮助读者判断系统在哪里失效、结果应如何解读。
多模态模型 · Shanghai AI Laboratory
OVO-S-Bench:流式空间智能评测把流式空间智能变成可检查任务,帮助读者判断系统在哪里失效、结果应如何解读。
用神经索引器预测下一步要用哪些 KV 块、只留在显存里,FlashMemory-DeepSeek-V4 把物理 KV 缓存压到全量基线的 13.5%,准确率几乎不降。
RTPurbo 用两阶段各约 600 步,把训练好的全注意力大模型转成稀疏注意力,LongBench 54.24 反超 53.80,1M 上下文预填充提速 9.36 倍。
长上下文 · University of Illinois Urbana-Champaign
Ctx2Skill 用多智能体自博弈,无需人工标注或外部奖励,从长上下文中挖出自然语言技能,把 GPT-4.1 从 11.1% 提到 16.5%。
KVarN 用 Hadamard 旋转加双轴方差归一化,把 KV 缓存压到 2-bit 且无需标定数据,专治长推理解码中量化误差逐步放大的问题。
δ-mem 给冻结的大模型挂上一块仅 8×8 的 delta 规则在线记忆,长记忆平均分较原模型提升 1.10×、较其他记忆方法提升 1.15×,无需微调、不扩上下文。
Gemini 1.5 Pro 与 Flash 在至少 1000 万 token 的文本、视频、音频里保持 99% 以上召回,且 Pro 用更少算力追平 Gemini 1.0 Ultra。
序列建模 · Carnegie Mellon University
Mamba 让状态空间模型参数随输入变化,按 token 选择记住或遗忘。它随长度线性扩展,推理吞吐是 Transformer 的 5 倍,3B 模型匹敌两倍参数 Transformer。