中文

用于从未见视点进行动作识别的合成人体

计算机视觉与模式识别 2021-05-25 v3

摘要

尽管合成训练数据已被证明有益于人体姿态估计等任务,但其在 RGB 人体动作识别中的使用相对较少被探索。本工作的目标是回答合成人体是否能改善人体动作识别性能这一问题,特别关注对未见视点的泛化能力。我们利用从真实动作序列进行单目 3D 人体重建的最新进展,自动为动作标签渲染合成训练视频。我们做出如下贡献:(i) 我们研究了有益于在新视点提升性能的变异与增强的程度。我们考虑个体的体型与服装变化,以及更具动作相关性的增强,如非均匀帧采样,以及在执行相同动作的个体运动之间进行插值;(ii) 我们引入了一种新的数据生成方法 SURREACT,可用于训练时空 CNN 进行动作分类;(iii) 我们在 NTU RGB+D 和 UESTC 标准人体动作多视点基准上大幅提升了动作识别的 SOTA 性能;最后,(iv) 我们将增强方法扩展到来自 Kinetics 数据集子集的野外视频,以研究仅有一-shot 训练数据可用的情况,并证明了在此情况下也有提升。

关键词

引用

@article{arxiv.1912.04070,
  title  = {Synthetic Humans for Action Recognition from Unseen Viewpoints},
  author = {Gül Varol and Ivan Laptev and Cordelia Schmid and Andrew Zisserman},
  journal= {arXiv preprint arXiv:1912.04070},
  year   = {2021}
}

备注

21 pages