中文

从单帧布局生成多目标视频

计算机视觉与模式识别 2023-05-24 v2

摘要

本文研究视频合成,重点在于简化生成条件。多数现有视频合成模型或数据集旨在处理单目标的复杂运动,缺乏全面理解多目标间时空关系的能力。此外,当前方法通常以精细标注(如视频分割)为条件生成新视频,本质上实用性不足。这促使我们以单帧的目标布局为唯一条件生成多目标视频。为解决上述挑战并受近期从布局生成图像研究的启发,我们提出了一种新颖的视频生成框架,通过隐式神经表示与布局运动自推断,能够合成含局部目标的全局场景。我们的框架是对图像生成方法的非平凡改造,且对该领域而言是全新的。此外,我们的模型在两个广泛使用的视频识别基准上进行了评估,相较基线模型证明了其有效性。

关键词

引用

@article{arxiv.2305.03983,
  title  = {Multi-object Video Generation from Single Frame Layouts},
  author = {Yang Wu and Zhibin Liu and Hefeng Wu and Liang Lin},
  journal= {arXiv preprint arXiv:2305.03983},
  year   = {2023}
}

备注

6 pages limit