中文

DragAnything:利用实体表示实现任意对象的运动控制

计算机视觉与模式识别 2024-03-18 v3

摘要

我们推出了 DragAnything,该方法利用实体表示在可控视频生成中实现对任意对象的运动控制。与现有的运动控制方法相比,DragAnything 具有多项优势。首先,基于轨迹的方法更利于用户交互,因为获取其他引导信号(如掩膜、深度图)费时费力,而用户只需在交互过程中绘制一条线(轨迹)。其次,我们的实体表示作为一种开放域嵌入,能够表示任何对象,从而实现对包括背景在内的多样实体的运动控制。最后,我们的实体表示允许对多个对象进行同时且独立的运动控制。大量实验表明,我们的 DragAnything 在 FVD、FID 和用户研究方面达到了最先进(SOTA)的性能,特别是在对象运动控制方面,我们的方法在人工投票中比之前的方法(如 DragNUWA)高出 26%。

关键词

引用

@article{arxiv.2403.07420,
  title  = {DragAnything: Motion Control for Anything using Entity Representation},
  author = {Weijia Wu and Zhuang Li and Yuchao Gu and Rui Zhao and Yefei He and David Junhao Zhang and Mike Zheng Shou and Yan Li and Tingting Gao and Di Zhang},
  journal= {arXiv preprint arXiv:2403.07420},
  year   = {2024}
}

备注

The project website is at: https://weijiawu.github.io/draganything_page/ . The code is at: https://github.com/showlab/DragAnything