中文

DragEntity: 利用实体与位置关系的轨迹引导视频生成

计算机视觉与模式识别 2024-10-15 v1

摘要

近年来,扩散模型在视频生成领域取得了巨大成功,其中可控视频生成受到了广泛关注。然而,现有的控制方法仍面临两个限制:首先,控制条件(如深度图、3D网格)对普通用户而言难以直接获取。其次,同时通过多条轨迹驱动多个物体进行复杂运动具有挑战性。在本文中,我们介绍了DragEntity,一种利用实体表示来控制多个物体运动的视频生成模型。与先前的方法相比,DragEntity具有两个主要优势:1) 我们的方法对交互更加用户友好,因为它允许用户拖动图像中的实体,而非单个像素。2) 我们使用实体表示来表示图像中的任何物体,并且多个物体可以保持相对空间关系。因此,我们允许同时使用多条轨迹以不同的复杂度级别控制图像中的多个物体。我们的实验验证了DragEntity的有效性,展示了其在视频生成中细粒度控制方面的卓越性能。

关键词

引用

@article{arxiv.2410.10751,
  title  = {DragEntity: Trajectory Guided Video Generation using Entity and Positional Relationships},
  author = {Zhang Wan and Sheng Tang and Jiawei Wei and Ruize Zhang and Juan Cao},
  journal= {arXiv preprint arXiv:2410.10751},
  year   = {2024}
}

备注

ACM MM2024 Oral