中文

MOVi:免训练的文本条件多对象视频生成

计算机视觉与模式识别 2025-05-30 v1

摘要

基于扩散的文本到视频(T2V)模型的最新进展展示了显著的进步,但这些模型在生成包含多个对象的视频时仍面临挑战。大多数模型难以准确捕捉复杂的对象交互,通常将某些对象视为静态背景元素并限制其运动。此外,它们通常无法生成提示中指定的多个不同对象,导致生成错误或对象间特征混合。在本文中,我们提出一种新颖的免训练多对象视频生成方法,该方法利用扩散模型和大型语言模型(LLM)的开放世界知识。我们使用 LLM 作为对象轨迹的“导演”,并通过噪声重新初始化应用这些轨迹,以实现对真实运动的精确控制。我们进一步通过操纵注意力机制来细化生成过程,以更好地捕捉对象特定特征和运动模式,并防止跨对象特征干扰。大量实验验证了我们免训练方法的有效性,显著增强了现有视频扩散模型的多对象生成能力,在运动动态和对象生成准确性上实现了 42% 的绝对提升,同时保持了高保真度和运动平滑度。

关键词

引用

@article{arxiv.2505.22980,
  title  = {MOVi: Training-free Text-conditioned Multi-Object Video Generation},
  author = {Aimon Rahman and Jiang Liu and Ze Wang and Ximeng Sun and Jialian Wu and Xiaodong Yu and Yusheng Su and Vishal M. Patel and Zicheng Liu and Emad Barsoum},
  journal= {arXiv preprint arXiv:2505.22980},
  year   = {2025}
}