中文

MotionRAG:基于运动检索增强的图像到视频生成

计算机视觉与模式识别 2025-10-01 v1

摘要

随着扩散模型的进步,图像到视频生成已取得显著进展,但生成具有逼真运动的视频仍然极具挑战性。这一困难源于精确建模运动的复杂性,这涉及捕捉物理约束、物体交互以及特定领域的动力学,这些特性难以在不同场景中泛化。为解决此问题,我们提出了 MotionRAG,一个通过上下文感知运动适应(CAMA)从相关参考视频中适应运动先验来增强运动真实感的检索增强框架。其关键技术创新包括:(i) 一个基于检索的流程,利用视频编码器和专门的再采样器提取高层运动特征,以提炼语义运动表征;(ii) 一种通过因果 Transformer 架构实现的上下文内学习方法,用于运动适应;(iii) 一个基于注意力的运动注入适配器,将迁移的运动特征无缝集成到预训练的视频扩散模型中。大量实验表明,我们的方法在多个领域和各种基础模型上均取得了显著改进,且推理时的计算开销可忽略不计。此外,我们的模块化设计通过仅更新检索数据库而无需重新训练任何组件,即可实现对新领域的零样本泛化。这项研究通过实现运动先验的有效检索与迁移,促进了逼真运动动力学的合成,从而增强了视频生成系统的核心能力。

关键词

引用

@article{arxiv.2509.26391,
  title  = {MotionRAG: Motion Retrieval-Augmented Image-to-Video Generation},
  author = {Chenhui Zhu and Yilu Wu and Shuai Wang and Gangshan Wu and Limin Wang},
  journal= {arXiv preprint arXiv:2509.26391},
  year   = {2025}
}