中文

实时运动可控的自回归视频扩散模型

计算机视觉与模式识别 2026-03-10 v3

摘要

由于双向扩散模型固有的延迟问题以及缺乏有效的自回归 (AR) 方法,实时运动可控视频生成始终具有挑战性。现有的 AR 视频扩散模型仅限于简单控制信号或文本到视频生成,且在少步生成时常出现质量下降和运动失真。为此,我们提出 AR-Drag——首个基于强化学习的少步 AR 视频扩散模型,实现实时图像到视频生成并支持多样化运动控制。我们首先微调基础 I2V 模型以支持基本运动控制,然后通过基于轨迹的奖励模型进一步通过强化学习进行优化。我们的设计通过自卷积机制保持马尔可夫性,通过有选择地引入去噪步骤的随机性来加速训练。大量实验表明,AR-Drag 在视觉保真度和运动精准对齐方面表现优异,显著降低了与最先进运动可控视频扩散模型相比的延迟,同时仅使用 13 亿参数。更多可视化结果可访问我们的项目页面:https://kesenzhao.github.io/AR-Drag.github.io/。

关键词

引用

@article{arxiv.2510.08131,
  title  = {Real-Time Motion-Controllable Autoregressive Video Diffusion},
  author = {Kesen Zhao and Jiaxin Shi and Beier Zhu and Junbao Zhou and Xiaolong Shen and Yuan Zhou and Qianru Sun and Hanwang Zhang},
  journal= {arXiv preprint arXiv:2510.08131},
  year   = {2026}
}