中文

个性化人体视频姿态估计

计算机视觉与模式识别 2016-06-16 v2

摘要

我们提出了一种个性化卷积网络(ConvNet)姿态估计器,它能自动适应人物外观的独特性,从而改进长视频中的姿态估计。我们的贡献如下:(i) 我们表明,给定少量高精度姿态标注(例如来自通用ConvNet姿态估计器),可利用基于图像的匹配(用于时间上相距较远的帧)与稠密光流(用于时间上相邻的帧)相结合,在整个视频中生成额外的标注;(ii) 我们开发了一个遮挡感知的自评估模型,能够自动筛选高质量标注并剔除错误的额外标注;(iii) 我们证明这些高质量标注可用于微调ConvNet姿态估计器,从而使其个性化以锁定人物外观的关键判别特征。结果是,与使用原始通用ConvNet相比,使用个性化ConvNet在目标视频上的姿态估计结果得到显著改进。我们的方法在两个标准基准以及一个具有挑战性的新YouTube视频数据集上,大幅优于当前最先进水平(包括顶尖的ConvNet方法)。此外,我们表明利用自动生成的标注进行训练可提升通用ConvNet在其他基准上的性能。

关键词

引用

@article{arxiv.1511.06676,
  title  = {Personalizing Human Video Pose Estimation},
  author = {James Charles and Tomas Pfister and Derek Magee and David Hogg and Andrew Zisserman},
  journal= {arXiv preprint arXiv:1511.06676},
  year   = {2016}
}

备注

CVPR 2016