中文

生成动作与物体零样本组合的视频

计算机视觉与模式识别 2020-07-20 v4 机器学习 图像与视频处理

摘要

人类活动视频涉及人与物体之间丰富且多样的交互。本文中我们开发了生成此类视频的方法——在解决复杂场景中视频生成这一重要开放问题上取得进展。具体而言,我们引入了在零样本组合设定下生成人-物交互视频的任务,即,生成在训练期间未见的动作-物体组合的视频,而在训练时已分别见过目标动作和目标物体。该设定对于人类活动视频生成的泛化尤为重要,避免了在训练中观察每个可能的动作-物体组合,从而规避了建模复杂场景所涉及的组合爆炸。为生成人-物交互视频,我们提出了一种名为 HOI-GAN 的新对抗框架,其包含多个关注视频不同方面的判别器。为证明我们所提框架的有效性,我们在两个具有挑战性的数据集 EPIC-Kitchens 和 20BN-Something-Something v2 上进行了大量定量与定性评估。

关键词

引用

@article{arxiv.1912.02401,
  title  = {Generating Videos of Zero-Shot Compositions of Actions and Objects},
  author = {Megha Nawhal and Mengyao Zhai and Andreas Lehrmann and Leonid Sigal and Greg Mori},
  journal= {arXiv preprint arXiv:1912.02401},
  year   = {2020}
}

备注

Accepted at ECCV'20; Project Page: https://www.sfu.ca/~mnawhal/projects/zs_hoi_generation.html