多模态模型 · 文生图 · 视觉基础模型

ARM 与 SenseNova-U1 对比:统一多模态模型的三条路线

ARM 用离散词元把理解、文生图、编辑装进一个 7B 模型(GenEval 0.86);SenseNova-U1 走连续像素路线(MMMU 80.55);HYDRA-X 扩到视频。

ARM 与 SenseNova-U1 对比:统一多模态模型的三条路线

快速结论

2026 年的「统一多模态模型」指一个网络同时做图像理解和图像生成,而不是视觉语言模型外挂一个扩散模型。三篇近作走了三条真不同的路线,而且共享几个基准,所以这个对比有真实数字可依,不是印象分:

  • ARM:一个 7B 自回归模型,共享的离散视觉词元同时服务理解、文生图和指令编辑,用同一个 next-token 目标训练。RL 把 GenEval 从 0.79 拉到 0.86,GEdit-Bench-EN 从 5.75 拉到 6.68。
  • SenseNova-U1:NEO-unify 架构,在连续像素空间里同时理解和生成,直接跳过 VAE。30B-A3B 混合专家版 MMMU 拿到 80.55,两个变体 GenEval 都是 0.91。
  • HYDRA-X:一个原生 ViT 词元器同时处理图像和视频,覆盖理解、生成、编辑。编辑侧报出 GEdit 总分 7.17,高于所列的 BAGEL。

核心矛盾:共享基准上,连续词元的 SenseNova-U1 理解明显更强(MMMU 80.55 对 ARM 的 40.2),生成也略好(GenEval 0.91 对 0.86);离散词元的 ARM 论证的是一个词元空间加 RL 能在 7B 里同时拿下三个任务。HYDRA-X 的证据多为内部消融,排名只能当方向性参考。下面的数字表每张都在最右列注明口径,不可互比的地方绝不混排。

关键数字

三篇里至少两篇报过的基准,可以并排看(注意各家自跑 harness):

基准ARM (7B)SenseNova-U1HYDRA-X (7B)口径说明
GenEval 总分(后训练后)0.86(ARM-RL)0.91(8B 与 A3B 同分)未报告同一基准、不同 harness;ARM 论文另列 Janus-Pro-7B 0.80、Qwen-Image 0.87
MMMURL 前 40.2,RL 后 41.080.55(A3B)、74.78(8B)未报告同一基准;ARM 论文列连续词元统一模型 Bagel 55.3、Show-o2 48.9 作参照
GEdit 总分6.68(ARM-RL)未报告7.17两篇都引 BAGEL 6.52;同基准家族、不同 harness
DPG / DPG-Bench86.00(ARM-RL,文中记为 DPG)88.14(A3B)、87.78(8B,DPG-Bench)未报告两篇命名不一致,视为相邻而非同一基准

只有单篇报告的头部数字(看清各队各自优化了什么,这些行不可跨论文对比):

论文头部数字测的是什么
ARMGEdit-Bench-EN 经 RL 从 5.75 升到 6.68;WISE 0.50 升到 0.56以 GPT-4.1/GPT-o3 当裁判的 GRPO 式 RL;带推理评分的生成
ARM词元器消融:四目标拿到 ImageNet 零样本 80.2、PSNR 19.6,只用 caption+像素则只有 0.2 和 15.2共享离散词元器是不是承重墙
SenseNova-U1CVTG-2K 平均 0.940;LongText-Bench 英文 0.979文字密集图像生成,它最强的细分
SenseNova-U1VSI-Bench:8B 拿 62.66,A3B 反而 56.90空间推理,小密集模型反超混合专家
HYDRA-XDAVIS rFVD 11.19(全注意力 16.20、因果注意力 14.05)视频重建上的词元器设计消融
HYDRA-X编辑消融:源目标交互把 PSNR 从 20.74 拉到 27.65,ImgEdit 2.80 到 3.20词元器内部交互路径的收益

读表守一条规矩:GenEval、MMMU、GEdit 行可以跨论文看;第二张表全是文内消融或别家没用的基准,只在单篇语境里成立。

三条路线各自怎么做到「统一」

统一的难点在表示。理解要语义,生成要保真,两篇论文在这架天平上选了不同的点。

ARM 押离散词元。一个视觉词元器同时受四个目标监督(caption、像素重建、SigLIP 式 sigmoid 对比、SigLIP2 特征蒸馏,加 FSQ 量化),同一套词元喂理解、文生图、编辑。消融就是论据:只用 caption 加像素,ImageNet 零样本 0.2、PSNR 15.2;四目标齐上,80.2 和 19.6。骨干之上是一个 GRPO 式 RL 阶段,裁判是 GPT-4.1 和 GPT-o3,把 GenEval 从 0.79 推到 0.86、GEdit 从 5.75 推到 6.68;论文还报告文生图和编辑的 RL 互相带动,而理解基本不动(MMMU 40.2 到 41.0,POPE 约 87)。

SenseNova-U1 押连续像素空间。NEO-unify 用 flow matching 经 MLP 解码器生成,彻底不经过 VAE,论点是跳过长压缩保生成保真度。代价出现在 predictable 的地方:逐 patch 的 FFN 和 MLP 头各自建模 32x32 小块,作者自己把可见的网格伪影归因于此。它的理解数字是三篇里最强的(MMMU 80.55、MMBench-EN 91.59、8B 上 OCRBench 82.10),而被记录在案的反常是 8B 密集模型在 VSI-Bench 空间推理上反超 30B-A3B 混合专家(62.66 对 56.90),作者自己把这解读为理解和生成仍在争夺容量。

HYDRA-X 押的是跨模态单一词元器,不只是跨任务。一个 ViT 词元器同时吃图像和视频,用 tubelet 注意力加层级时序 patchify 做时序压缩;消融显示全时空注意力反而伤重建(DAVIS rFVD 16.20 对 tubelet 的 11.19)。编辑上,词元器内部的源目标交互路径把重建 PSNR 从 20.74 抬到 27.65,受控实验里 ImgEdit 从 2.80 升到 3.20。三篇里只有它报了视频理解数字(MVBench 59.1、Video-MME 60.0、LongVideoBench 59.5)。

怎么选

  • 选 SenseNova-U1:产品理解为主(文档 OCR、图表问答、多模态对话),但同一套权重也要出图。0.91 GenEval 加 80.55 MMMU 是本次对照里最好的组合成绩,文字密集生成(英文 LongText-Bench 0.979)也切中真实产品场景。留意像素输出的网格伪影,以及 GenEval 属性绑定不到 0.80 的短板。
  • 选 ARM:想要一个 7B 小一体化栈,且必须带指令编辑,能接受离散词元。它没有任何单项榜首(GenEval 0.86 低于 Qwen-Image 的 0.87,GEdit 6.68 低于 Step1X-Edit 的 6.70),但那些榜上的专科模型没有一个同时能读图。代价:RL 收益依赖专有 GPT 裁判,0.79 到 0.86 的增幅难以复现;MMMU 40.2 说明理解不是它的强项。
  • 选 HYDRA-X:视频要和图像进同一个词元空间时。三篇里只有它的架构为此设计,消融也把设计选择和数字连得很干净。代价:最强证据是内部实验,缺少广泛外部复现,且专有视频模型在多个理解指标上仍领先。

如果今天要的是最强静图编辑,三篇都不是答案:BAGEL、Step1X-Edit 这类扩散编辑模型在 GEdit 上比这里的任何统一模型都高。统一模型的赌注赌的是系统数量,不是峰值分数。

局限与存疑

三篇共有的结构性局限:头部生成数字各自对着奖励不同维度的基准(GenEval 数物体、GEdit 看指令保真、DPG 看提示对齐),真正有交集的只有 GenEval、MMMU、GEdit 三个。ARM 和 HYDRA-X 的 GEdit 来自不同 harness,7.17 对 6.68 的差距应读作「HYDRA-X 在自家设定下宣称领先」,而不是受控对打。

可复现性差别很大。ARM 的 RL 阶段要复现主增益必须接 GPT-4.1 和 GPT-o3。SenseNova-U1 对弱点的记录异常坦诚(网格伪影、属性 binding、VSI-Bench 反常),但混合专家的扩展行为提示容量竞争被「协同」叙事低估了。HYDRA-X 消融逻辑最强、外部效度最弱,发布时完整放出的细节仍待定。最后,三篇都没有给出统一栈对比「一个 VLM 旁边跑一个扩散模型」的受控时延和 serving 成本,而这才是统一架构真正要击败的基线。

常见问题

ARM 和 SenseNova-U1 的文生图谁更强?

看共享的 GenEval 基准,SenseNova-U1 略领先:8B 和 A3B 两个变体总分都是 0.91,ARM 经 RL 后是 0.86(RL 前 0.79)。ARM 论文在同一张表里列了 Qwen-Image 0.87、Janus-Pro-7B 0.80,SenseNova-U1 的 0.91 已与专科生成模型同档。两家 harness 不同,但这是两篇论文能给出的最接近正面回答的数字。

ARM 的 MMMU 为什么落后 SenseNova-U1 约 40 分?

ARM 报 RL 前 40.2、RL 后 41.0;SenseNova-U1 报 80.55(A3B)和 74.78(8B)。ARM 论文自己在同一基准上列了远超它的连续词元统一模型(Bagel 55.3、Show-o2 48.9),所以这个差距更像离散词元在理解类基准上的表示代价,而不是训练事故。如果理解质量决定产品,这一行比任何生成数字都重要。

HYDRA-X 的编辑结果和 BAGEL 相比如何?

在报告的列上领先:HYDRA-X 列了 GEdit 总分 7.17、ImgEdit 4.34,高于 BAGEL;ARM 的独立表里 BAGEL 是 6.52。但这应读作宣称领先而非受控对比,因为数字出自 HYDRA-X 自家 harness,而它最硬的证据是内部消融(源目标交互把编辑 PSNR 从 20.74 抬到 27.65)。

统一多模态模型现在打赢扩散专科模型了吗?

原始生成和编辑分数上都没有。ARM-RL 的 GenEval 0.86 低于 Qwen-Image 的 0.87,GEdit 6.68 低于 Step1X-Edit 的 6.70、与 BAGEL 的 6.52 大致打平。统一模型的论据是系统数量效率:一个接近专科水平的模型同时会读会画,而不是每张专科榜都登顶。

三篇的可复现性如何对比?

ARM 的 RL 用 GPT-4.1 和 GPT-o3 当裁判,GenEval 0.79 到 0.86 的增幅脱离专有模型难以复现。HYDRA-X 发布时完整细节未定。SenseNova-U1 对管线和失败模式的公开最充分,但所有数字同样出自自家 harness,这一点人人如此。