多模态模型 · ARM vs SenseNova-U1 vs HYDRA-X
ARM 与 SenseNova-U1 对比:统一多模态模型的三条路线
ARM 用离散词元把理解、文生图、编辑装进一个 7B 模型(GenEval 0.86);SenseNova-U1 走连续像素路线(MMMU 80.55);HYDRA-X 扩到视频。
对比
方法与模型的正面对比,数字来自原论文。
多模态模型 · ARM vs SenseNova-U1 vs HYDRA-X
ARM 用离散词元把理解、文生图、编辑装进一个 7B 模型(GenEval 0.86);SenseNova-U1 走连续像素路线(MMMU 80.55);HYDRA-X 扩到视频。
世界模型 · Interactive world models vs World models for agents
四篇 2026 论文把交互式世界模型拆成四种接口:Kairos 单卡可跑,WALL-WM 按事件切监督,Gamma-World 多人 24 FPS,WorldCraft 加物体操作。
多模态模型 · Spatial reasoning vs MLLMs vs visual agents
三路攻 MLLM 空间推理:SpatialClaw 工作区 20 榜均分 59.9,ReRe 合成新视角 2B 模型 VSI-Bench +8.5,视频模型带着 VLM 缺的几何。
视频生成 · Causal Forcing++ vs AnyFlow
都把 Wan2.1 蒸馏到低成本:Causal Forcing++ 钉死每帧 1-2 步换 14.1 FPS 实时出流,AnyFlow 让步数自由、质量随步数上升。
语音识别 · Whisper vs Mega-ASR
Whisper 赌 68 万小时真实网络音频的多样性;Mega-ASR 造 240 万条合成退化片段,VOiCES 上 WER 45.69% 对 54.01%。两边数字不在同一张考卷上。
文生图 · Qwen-Image 2.0 vs Qwen-Image-Flash
Qwen-Image 2.0 是全能图像底座:1K token 指令、原生 2K、16 倍 VAE。Flash 把它蒸到 4 步,靠数据配方在自家评测里追平老师。
脑解码 · MindEye vs Brain Diffuser vs MinD-Vis
同一 NSD 基准三个系统:MindEye 检索 93.6% 碾压,Brain Diffuser 赢 SSIM,MinD-Vis 的数字来自另一个数据集。
文生图 · DALL·E 2 vs Stable Diffusion vs Imagen
DALL·E 2 在 CLIP 嵌入空间加扩散先验,Stable Diffusion 在潜空间降噪,Imagen 靠冻结 T5 做像素级联,SD3 用整流流 Transformer 收尾。
长上下文 · Kimi K3 vs DeepSeek V4 vs Qwen3.8-Next vs Nemotron 3 Ultra
四家 2026 前沿开源模型各用各的法子撑 1M 上下文:K3 用 Delta 注意力,V4 压缩 KV,Qwen 用 GDN,Nemotron 靠 Mamba-2 换吞吐。
多模态模型 · Keye-VL 2.0 vs InternVideo3
Keye-VL 2.0 走稀疏注意力长上下文路线(LongVideoBench 74.1);InternVideo3 用 80 亿小模型加智能体回路(Video-MME +2.7)。
强化学习 · Agentic RL vs APPO vs LongTraceRL vs SDAR vs SCOPE
GRPO 给多轮智能体一回合一个标量奖励,四篇论文分别在分支、数据与奖励、蒸馏、自我博弈四层修信用分配,这是各自的数字。
检索增强生成 · vector retrieval vs agentic retrieval
向量检索把语料压成每段一个相似度分数,代价是什么?站上五篇论文从接口、读者、引用、配置、评测五个层面给出各自的修复方案,数字和边界都在这。
代码生成 · AlphaCode vs Code Llama
AlphaCode 用海量采样加筛选换来 Codeforces 前 54.3%;Code Llama 把开放权重做到 HumanEval 67%:两台机器干的是两件事。
强化学习 · Self-distillation in RLVR vs Privileged-context teachers vs Dense token-level rewards
RLVR 一轨迹一比特。SDPG 在判对轨迹上照搬提示教师,SDAR 逐 token 门控照搬,AntiSD 奖励分歧而非照搬:同一特权教师信号的三种花法。
AI 智能体 · SkillOpt vs Ctx2Skill vs OpenSkill vs LatentSkill vs SkillAdaptor vs SkillsVote
六篇 2026 年论文让智能体不重训就学会新技能:SkillOpt 把技能文档训出 +23.5 分,Ctx2Skill 自博弈挖技能,OpenSkill 零监督自学,附真实数字与选型。
AI 智能体 · RHO vs Harness-1
RHO 事后从无标注轨迹调优 harness;Harness-1 事前设计 harness 让 RL 只学语义判断。同一前提,两个问题,全部用论文原始数字。
代码生成 · SWE-Explore vs DeNovoSWE vs Claw-SWE-Bench
三篇 2026 年论文拆开代码智能体的得分来源:探索定位卡在 0.15-0.20 行级召回,4818 个任务把 30B 模型提升 8 倍,光换 harness 就摆动 27.4 分。
语音合成 · VALL-E vs NaturalSpeech 2 vs SwanVoice
同为零样本 TTS,三篇论文赌的是三个生成单元:VALL-E 把语音当 codec 语言模型,NaturalSpeech 2 用扩散生成连续隐向量,SwanVoice 一次生成整段对话。
图像分割 · Mask2Former vs Mask R-CNN vs SAM vs SAM 2
43.7 对 37.2,Mask2Former 领先 Mask R-CNN;SAM 零样本 46.5 对 51.0;SAM 2 视频 76.8 J&F 超 XMem 60.1,快 6 倍。
文本嵌入 · Sentence-BERT vs SimCSE vs E5
SBERT 把 1 万句相似从 65 小时缩到 5 秒;SimCSE 用 dropout 造正样本对,无监督 76.25、有监督 81.57;E5 零样本在 56 个数据集上首超 BM25。
智能体记忆 · MemGPT vs MRAgent vs δ-mem vs EvoMem
MemGPT 像操作系统一样换页,MRAgent 边推理边重建记忆图,δ-mem 把历史压进 8×8 参数状态,EvoMem 记录事实如何被改写:四种架构,四个「记忆放在哪」的答案。
自监督学习 · SimCLR vs BYOL vs MAE vs DINOv2
SimCLR 负样本大 batch 到 69.3;BYOL 去负样本 74.3 且小 batch 稳;MAE 微调 87.8 冻结崩;DINOv2 冻结 86.3 超 OpenCLIP。
AI 定理证明论文精选 · AI theorem provers vs formal mathematics
三家都报出了漂亮的数学成绩,但它们证明的是三种不同的定理,验证器和搜索预算也完全不同。这篇讲清每个数字到底测了什么。
视频生成 · Stream-T1 vs Echo-Infinity vs SANA-Streaming vs Causal Forcing++
四篇论文都自称实时视频生成,但解决的是四个不同问题,帧率数字不能直接互相比。
视觉-语言-动作 · RT-2 vs π0 vs Qwen-VLA vs MolmoAct2 vs World Pilot
RT-2 把动作写成文本 token,π0 换成 50Hz 的流匹配动作块,2026 年的新模型又加上三维推理和世界模型先验。榜单数字显示仿真已近饱和,真机差距和分布外泛化才是分水岭。
小语言模型 · Phi-3 vs SmolLM2 vs MobileLLM vs TinyLlama
40 亿参数以下没有冠军:Phi-3 精选数据到 MMLU 69;SmolLM2 胜过 Llama3.2-1B 但数学输给 Qwen2.5-1.5B;MobileLLM 再涨 4.3%。
强化学习 · DelTA vs AntiSD vs DVAO
RLVR 只在答案末尾给一个对错信号,三个 2026 年的方法在不同层修这件事:DelTA 重加权更新方向,AntiSD 造逐 token 的稠密奖励,DVAO 按组内方差自动配比多路奖励。
对齐 · RLHF vs DPO
RLHF 要训一个奖励模型再跑 PPO;DPO 用一个闭式改写把这两步整个删掉,直接在有偏好的回答对上做分类式训练。数字上它是「一样好甚至更好,而且简单得多」,但有几个真坑。
扩散语言模型 · Diffusion language models vs Autoregressive language models
8B 的掩码扩散语言模型已能在 MMLU 上打平同尺寸自回归模型、在 GSM8K 上领先,只用六分之一的 token,还解决了反转诅咒。解码速度、短提示条件生成和服务栈成熟度仍偏向自回归。
强化学习 · GRPO vs PPO
GRPO 用同组采样答案的平均奖励替代 PPO 学习出来的价值模型,少一个和策略同样大的模型,让开源推理 RL 变得可负担,代价是失去逐 token 的信用分配并带来新的不稳定。
微调与适配 · LoRA vs Full fine-tuning
标准任务上 LoRA 与全量微调只差一分以内,可训练参数少一万倍;但它靠的是入侵维度,这些方向承担了遗忘,起初有利,持续训练下反而吃亏。
序列建模 · Mamba vs Transformer
Mamba 用固定大小的选择性状态换掉注意力的平方计算和 KV 缓存:解码吞吐 5 倍、3B 上打平两倍大的 Transformer,但精确回忆仍属于注意力。
语言模型 · Muon vs AdamW
Muon 预训练用约一半 FLOPs 达到 AdamW 的损失,DeepSeek-V4、Kimi K3 已采用;用于 AdamW 模型的 SFT 会丢分,RL 里会崩。
长上下文 · Sparse attention vs Full attention
稀疏注意力在 100 万 token 上把注意力计算量压到 1/7 到 1/28,长上下文基准只掉半分左右;但实际耗时的收益远小于 FLOPs 的收益,32K 以下几乎看不见。
世界模型 · World models vs LLMs
大语言模型用语言在规则和目标上推理,世界模型预测一个场景接下来会怎样。2026 年的证据说两者互补,难点在第三种能力:判断一段生成出来的未来可信到什么程度,能不能据此行动。