中文

RAGME:检索增强视频生成以提升运动真实性

计算机视觉与模式识别 2025-04-10 v1

摘要

视频生成正快速发展,推动了扩散模型的进步以及更好更大数据集的开发。然而,产出高质量视频仍具有挑战性,由于数据维度高且任务复杂。近期努力主要聚焦于提升视觉质量并解决时序不一致性问题(如闪烁)。尽管已取得进展,但生成的视频在运动复杂度和物理合理性方面常常不足,许多输出要么看起来静态,要么呈现不切实际的运动。本文提出一种框架来改善生成视频中运动的真实性,探索了与大量现有文献不同的补充方向。具体而言,我们主张在生成阶段融入检索机制。检索到的视频作为 grounding 信号,为模型提供运动方式的示例。我们的管道设计可适用于任意文本到视频扩散模型,通过对预训练模型进行最小化微调来实现条件化。我们通过既定指标、最新基准和定性结果均展示了该方法的优越性,并突出了该框架的其他应用。

关键词

引用

@article{arxiv.2504.06672,
  title  = {RAGME: Retrieval Augmented Video Generation for Enhanced Motion Realism},
  author = {Elia Peruzzo and Dejia Xu and Xingqian Xu and Humphrey Shi and Nicu Sebe},
  journal= {arXiv preprint arXiv:2504.06672},
  year   = {2025}
}

备注

Code available at: https://github.com/helia95/ragme