中文

从多镜头中恢复人体网格

计算机视觉与模式识别 2020-12-18 v1

摘要

来自电影等编辑媒体的视频是有用但未被充分探索的信息来源。这些影片中在较大时间上下文中描绘的人体外观和交互的丰富多样性可能是一个有价值的数据源。然而,数据的丰富性带来了根本性挑战,例如突兀的镜头切换和演员被严重截断的特写镜头,这限制了现有人体3D理解方法的适用性。在本文中,我们通过一个见解来解决这些限制:虽然同一场景的镜头切换会导致帧间的不连续性,但场景的3D结构仍然平滑变化。这使我们能够将镜头切换前后的帧作为多视图信号处理,为恢复演员的3D状态提供强线索。我们提出了一个多镜头优化框架,从而改进了3D重建并利用伪地面真实3D人体网格挖掘长序列。我们表明,所得数据有益于各种人体网格恢复模型的训练:对于单图像,我们实现了改进的鲁棒性;对于视频,我们提出了一种纯基于Transformer的时间编码器,它可以自然地处理由于输入帧中的镜头切换导致的缺失观测。我们通过广泛的实验证明了该见解和所提模型的重要性。我们开发的工具为处理和以3D分析来自大型编辑媒体库的内容打开了大门,这可能有助于许多下游应用。项目页面:https://geopavlakos.github.io/multishot

关键词

引用

@article{arxiv.2012.09843,
  title  = {Human Mesh Recovery from Multiple Shots},
  author = {Georgios Pavlakos and Jitendra Malik and Angjoo Kanazawa},
  journal= {arXiv preprint arXiv:2012.09843},
  year   = {2020}
}