中文

FreeTraj:无需调参的视频扩散模型轨迹控制

计算机视觉与模式识别 2024-06-25 v1

摘要

扩散模型在视频生成方面展现出惊人的能力,这进一步激发了对引入轨迹控制的兴趣。虽然现有工作主要集中在训练导向的方法(例如条件适配器),但我们认为扩散模型本身在不要求任何训练的情况下也能实现相当程度的控制。在本研究中,我们引入一个无需调参的框架,以实现可控的视频轨迹生成,通过对噪声构建和注意力计算施加指导。具体地,1) 我们首先展示了若干有启发意义的现象,并分析了初始噪声如何影响生成内容的运动轨迹。2) 随后,我们提出FreeTraj,这是一种无需调参的方法,通过修改噪声采样和注意力机制实现轨迹控制。3) 此外,我们扩展FreeTraj以便于更长更大的视频生成,以实现可控的轨迹。通过这些设计,用户可以灵活地手动提供轨迹,或选择由LLM轨迹规划器自动生成的轨迹。广泛的实验验证了我们方法在增强视频扩散模型轨迹可控性方面的有效性。

关键词

引用

@article{arxiv.2406.16863,
  title  = {FreeTraj: Tuning-Free Trajectory Control in Video Diffusion Models},
  author = {Haonan Qiu and Zhaoxi Chen and Zhouxia Wang and Yingqing He and Menghan Xia and Ziwei Liu},
  journal= {arXiv preprint arXiv:2406.16863},
  year   = {2024}
}

备注

Project Page: http://haonanqiu.com/projects/FreeTraj.html, Code Repo: https://github.com/arthur-qiu/FreeTraj