中文

通过对比跨视角互信息最大化学习视角解耦的人体姿态表示

计算机视觉与模式识别 2021-03-29 v2

摘要

我们提出一种新颖的表示学习方法,从 2D 人体姿态中解耦出依赖于姿态以及依赖于视角的因素。该方法以对比学习的方式使用跨视角互信息最大化(CV-MIM)训练网络,最大化同一姿态在不同视角下执行的互信息。我们进一步提出两个正则化项以确保所学表示的解耦性与平滑性。所得姿态表示可用于跨视角动作识别。为评估所学表示的效力,除常规全监督动作识别设定外,我们引入称为单次跨视角动作识别的新任务。该任务仅用单一视角的动作训练模型,而在所有可行视角捕获的姿态上评估模型。我们在动作识别标准基准上评估所学表示,表明(i)CV-MIM 在全监督场景下与最先进(SOTA)模型相比具竞争力;(ii)CV-MIM 在单次跨视角设定下大幅优于其他竞争方法;(iii)当减少监督训练数据量时,所学表示能显著提升性能。我们的代码公开于 https://github.com/google-research/google-research/tree/master/poem

关键词

引用

@article{arxiv.2012.01405,
  title  = {Learning View-Disentangled Human Pose Representation by Contrastive Cross-View Mutual Information Maximization},
  author = {Long Zhao and Yuxiao Wang and Jiaping Zhao and Liangzhe Yuan and Jennifer J. Sun and Florian Schroff and Hartwig Adam and Xi Peng and Dimitris Metaxas and Ting Liu},
  journal= {arXiv preprint arXiv:2012.01405},
  year   = {2021}
}

备注

Accepted to CVPR 2021 (Oral presentation). Code is available at https://github.com/google-research/google-research/tree/master/poem