视频生成 · 高效 AI · 扩散模型

流式视频生成对比:四种方法如何各自实现「实时」

四篇论文都自称实时视频生成,但解决的是四个不同问题,帧率数字不能直接互相比。

流式视频生成对比:四种方法如何各自实现「实时」

「实时」的四种含义

这四篇论文都说自己是「实时」视频生成,但没有两篇指的是同一件事。SANA-Streaming 说的是直播:在单张 RTX 5090 上以 1280x704 实时编辑进来的视频流。Causal Forcing++ 说的是交互:帧要赶在你的反应速度之前流出来,所以约束条件是首帧延迟而不是平均帧率。Echo-Infinity 说的是持久:单帧不算快,但能连续生成 24 小时场景不散架。Stream-T1 又是另一回事——它根本不生成视频,而是一个搜索包装器,在冻结的流式模型上多花推理算力把质量买回来。

这很重要,因为这类论文的 FPS 数字经常被并排引用,好像一张排行榜。其实不是:硬件不同(RTX 5090 对 H100 对 A800)、任务不同(编辑对文生视频对交互动作条件)、速度定义也不同(端到端管线对 DiT 核心单独跑)。下面的表刻意让每个数字都钉在自己的设定上。

关键数字

方法是什么报告的速度硬件标志性质量数字同一套评测?
SANA-Streaming线性加 softmax 混合 DiT,做流式视频编辑端到端 24 FPS;DiT 核心单独 58 FPS1 张 RTX 50901280x704;时序一致性「超 SOTA」但未公布具体指标值编辑任务,无共享基准
Echo-Infinity用可学习记忆 Query token 替代固定 KV 缓存调度的 AR DiT18.5 FPS1 张 H100VBench-Long 30 秒 85.61、240 秒 82.01;24 小时连续生成超 130 万帧VBench-Long;速度对手 LongLive 20.7、MemFlow 18.7、M&G 21.7 FPS
Causal Forcing++把双向扩散蒸馏成逐帧、每帧 1–2 步的 AR 生成器2 步时 14.1 FPS;首帧延迟 0.27 秒Wan2.1-1.3B 学生VBench 总分 2 步 84.14 对 4 步基线 84.04;VisionReward 6.661 对 6.326是,步数消融同模型同基准
Stream-T1冻结 LongLive 上的免训练测试时搜索包装器在 LongLive 的 16 FPS、832x480 设定下评测;每块额外多花推理算力不适用VideoAlign 运动质量 5 秒 0.350→0.629;30 秒 −0.002→0.226是,同一骨干,加包装前后对比

有两行值得再读一遍。Echo-Infinity 在自己的速度对比里反而是「最慢」的(LongLive 20.7 FPS 对它的 18.5),但长卷展恰好该选它,因为它在 240 秒的 VBench-Long 还能守住 82.01,而固定记忆的方法已经漂移。速度持平本身就是目的:它买的是稳定,不是吞吐。Stream-T1 的「16 FPS」根本不是它的速度主张,那只是它包装的冻结基线的评测设定;它真正的成本是每个块上扩展并打分候选带来的、未被报告的推理倍数。

共同的敌人:长视频漂移

这四个方法的存在都是因为自回归流式生成有一个结构性弱点:流式模型一块一块生成视频,每块依赖对前面的记忆。记忆保留什么,保留得都不完美;丢掉什么,模型就会瞎编回来。误差复利式积累:第三块的一个小瑕疵带偏第四块,主体慢慢变形,到 30 秒画面已经明显劣化。Stream-T1 直接量化了这一点:它冻结的基线在 30 秒时 VideoAlign 运动质量是 −0.002,基本等于零;Echo-Infinity 自己的数字也显示语义在衰减,即使画面还撑得住:语义分从 5 秒的 81.49 掉到 240 秒的 59.53。

四篇论文攻击的是这个循环的不同环节,该选哪个取决于你的瓶颈到底在哪。

四种打法

Causal Forcing++ 削减每帧的步数。 双向扩散要一次性生成整段视频,最后一帧未定之前第一帧吐不出来,交互性被杀。自回归是解药,但朴素的 AR 扩散每帧仍要很多去噪步。Causal Forcing++ 把双向教师蒸馏成每帧只需 2 步的逐帧生成器:14.1 FPS,对比它自己 4 步逐帧变体的 8.69 FPS 和分块版 Causal Forcing 的 10.4 FPS;首帧延迟从 0.60 秒砍到 0.27 秒。工程上的大头在训练:用在线因果一致性蒸馏替代预计算轨迹的 ODE 蒸馏,少步初始化阶段从 11,600 降到 2,900 A800 GPU 小时,约 4 倍,且零轨迹存储。我们论文页的诚实读法:VBench 总分只从 84.04 挪到 84.14,在噪声范围内。这是效率论文,不是质量飞跃;而且它的动作条件世界模型变体仍停在 4 步分块,「完全实时」只适用于提示驱动的生成。

Echo-Infinity 用学出来的记忆替代调好的记忆。 以往的无限视频方法用固定规则管理历史:KV 缓存窗口、固定压缩比、RoPE 修补:不管内容是什么,信息都以同一种方式被丢弃。Echo-Infinity 维护一小组可学习的记忆 Query token:帧离开局部注意力窗口时,信息经注意力与门控折进这些 token,而 token 与扩散变压器端到端联合训练。任意长度下每帧算力恒定。真正证明其价值的是持久性:单张 H100 上 18.5 FPS 实时连续生成 24 小时、超过 130 万帧,240 秒 VBench-Long 82.01。如我们论文页所指出的,240 秒语义分 59.53 说明语义仍在侵蚀——记忆让画面撑得久得多,但不是语义上永远不散。

Stream-T1 花算力而不是训练。 给定一个冻结的流式模型,测试时搜索能买回多少质量?Stream-T1 在每个块上跑三个协同技巧:从前一块潜变量球面插值的噪声传播;扩展多个候选续接并用帧级与视频级奖励模型在滑动窗口上打分剪枝;把被逐出 KV 缓存的条目按检测到的语义边界分派到丢弃、EMA 平滑汇聚或直接追加三个去向。增益最大的地方正是漂移最狠的地方:同一 LongLive 骨干上,30 秒 VideoAlign 运动质量从 −0.002 拉到 0.226。代价见我们论文页:搜索成倍增加推理成本,与「实时」定位存在未解决的张力;且优化奖励模型可能滑向「讨好评分器」而非「真的好看」。

SANA-Streaming 为编辑做模型、训练、内核的协同设计。 它的目标不是开放式生成,而是实时视频到视频编辑,这多了一条其他论文没有的约束:输出必须跟得上真实输入流。三块拼图合上了这个缺口:混合 DiT 在本来全是线性注意力的骨干里给部分块加回 softmax 注意力;Cycle-Reverse 正则化通过从生成结果反推源帧来逼时序一致,绕开了「成对长编辑视频数据集根本不存在」的问题;再加上 Blackwell 专用融合内核与混合精度量化。数字:单张 RTX 5090 上 1280x704 端到端 24 FPS,DiT 核心单独 58 FPS。注意 24 和 58 之间的差距:瓶颈是外围管线而不是模型。还要注意时序一致性「超 SOTA」的说法没有公布指标值,我们论文页已标明。

怎么选

  • 交互或游戏式生成、预算紧: Causal Forcing++。只有它报告了首帧延迟(0.27 秒)和分步训练成本,这正是帧要按反应速度往外吐时你要优化的东西。
  • 几分钟到几小时的连贯视频: Echo-Infinity。它的 FPS 居中,是设计使然;它买的是 240 秒 VBench-Long 的稳定和 24 小时卷展。
  • 消费级单卡上实时编辑真实视频流: SANA-Streaming。这里没有其他方法能在单卡上做 1280x704 的 V2V。
  • 冻结的流式模型不能重训: Stream-T1。它是包装器,数字都长在基线的评测设定(16 FPS、832x480)上,成本体现在推理而不是训练。

局限与存疑

这四篇论文没有两篇共享同一套基准、硬件和任务,所以任何跨四者的总排名都是虚构,上表特意逐行标注。流式质量指标本身也弱:Stream-T1 自己的结果显示 VBench 一致性分在基线上已停在 97–99,几乎没 headroom 来度量真实进步,而真正能动的奖励模型指标只有奖励模型本身那么可靠。长程语义在所有地方都没解决:59.53 是这页上最好的长程语义数字,仍远低于短视频分数。而「实时」主张对定义很敏感:端到端对核心 FPS、提示驱动对动作条件、单卡对整机,答案都会变。

常见问题

这四个方法的结果数字能直接对比吗?

不能。SANA-Streaming 的 24 FPS 是单张 RTX 5090 上的视频编辑,Causal Forcing++ 的 14.1 FPS 是 Wan2.1-1.3B 上的文生视频,Echo-Infinity 的 18.5 FPS 是 H100 上的超长卷展。硬件、任务、速度定义全不同,只能同方法前后对比,不能跨方法排名。

流式视频模型如何避免长视频漂移?

三个方法直接对抗漂移:Echo-Infinity 学习该压缩什么进记忆 token,而不是按固定调度逐出;Stream-T1 用视频奖励模型剪枝候选块;SANA-Streaming 通过反推源帧训练一致性。Causal Forcing++ 主攻延迟,漂移作为遗留问题继承了下来。具体数字见上面的表。

SANA-Streaming 和 Causal Forcing++ 的方法有什么不同?

SANA-Streaming 是系统协同设计:混合注意力骨干、Cycle-Reverse 正则化、Blackwell 专用内核与量化,目标是让编辑管线在消费级显卡上跟上真实视频流。Causal Forcing++ 是蒸馏:把双向扩散教师蒸成每帧 2 步的逐帧生成器,用首帧延迟 0.27 秒换取交互性。一个优化管线吞吐,一个优化每帧步数。

视频扩散模型如何在单张消费级显卡上实时跑?

SANA-Streaming 在单张 RTX 5090 上演示了 1280x704 编辑端到端 24 FPS,但其内核与量化为 Blackwell 调优,可移植性未验证。Causal Forcing++ 用 1.3B 学生模型,接近消费级,但报告数字用的是数据中心 A800 训练硬件。

不重训做测试时扩展,方法上有哪些代价?

Stream-T1 证明了这条路可行:包装冻结的 LongLive,5 秒 VideoAlign 运动质量从 0.350 提到 0.629,30 秒从约零提到 0.226。代价是每个块上扩展并打分候选带来的额外推理算力,与实时目标相抵,还可能滑向奖励模型喜欢而非人眼喜欢的画面。

超长视频生成该选哪个方法?

按已实测的长程稳定性是 Echo-Infinity:240 秒 VBench-Long 82.01,并演示了 24 小时、超 130 万帧的连续卷展。它自己的长程语义分(240 秒 59.53)说明语义仍在衰减,所以这里的「最好」是「劣化最慢」,不是「已解决」。

一句话:「实时视频生成」是四个不同问题共用一个名字——砍每帧步数、学习该记什么、测试时搜索、或整条管线协同设计。谁的瓶颈和你一致就选谁。完整拆解见 Stream-T1、Echo-Infinity、SANA-Streaming 和 Causal Forcing++ 的论文页。