中文

ReVision:基于显式 3D 运动建模的视频扩散精炼

计算机视觉与模式识别 2026-01-12 v2

摘要

近年来,视频生成取得了显著进展,但在生成复杂运动与相互作用方面仍面临挑战。为此,我们引入 ReVision,一个即插即用的框架,显式地将参数化 3D 模型知识集成到预训练的条件视频生成模型中,显著提升其生成高质量、复杂运动与相互作用视频的能力。具体而言,ReVision 包含三个阶段。首先,使用视频扩散模型生成粗糙视频。随后,从该粗糙视频中提取一组 2D 与 3D 特征,构建基于对象的 3D 表示,并通过我们提出的参数化运动先验模型进行精炼,以产出准确的 3D 运动序列。最后,将该精炼运动序列反馈至相同的视频扩散模型作为额外条件输入,实现运动一致性视频的生成,即便在涉及复杂动作与相互作用的情景下也能如期实现。我们在 Stable Video Diffusion 上验证了方法的有效性,ReVision 在运动保真度与一致性方面显著优于基线方法。惊人的是,仅凭 15 亿参数,ReVision 便在复杂视频生成任务中超越了参数超过 130 亿的领先视频生成模型,优势显著。我们的结果表明,通过融入 3D 运动知识,即便是相对较小的视频扩散模型,也能以更高的真实性和可控性生成复杂运动与相互作用,为实现物理上可信的视频生成提供了有前景的解决方案。

关键词

引用

@article{arxiv.2504.21855,
  title  = {ReVision: Refining Video Diffusion with Explicit 3D Motion Modeling},
  author = {Qihao Liu and Ju He and Qihang Yu and Liang-Chieh Chen and Alan Yuille},
  journal= {arXiv preprint arXiv:2504.21855},
  year   = {2026}
}

备注

TMLR camera-ready version. Project Page: https://revision-video.github.io/