个性化人体视频姿态估计
计算机视觉与模式识别
2016-06-16 v2
摘要
我们提出了一种个性化卷积网络(ConvNet)姿态估计器,它能自动适应人物外观的独特性,从而改进长视频中的姿态估计。我们的贡献如下:(i) 我们表明,给定少量高精度姿态标注(例如来自通用ConvNet姿态估计器),可利用基于图像的匹配(用于时间上相距较远的帧)与稠密光流(用于时间上相邻的帧)相结合,在整个视频中生成额外的标注;(ii) 我们开发了一个遮挡感知的自评估模型,能够自动筛选高质量标注并剔除错误的额外标注;(iii) 我们证明这些高质量标注可用于微调ConvNet姿态估计器,从而使其个性化以锁定人物外观的关键判别特征。结果是,与使用原始通用ConvNet相比,使用个性化ConvNet在目标视频上的姿态估计结果得到显著改进。我们的方法在两个标准基准以及一个具有挑战性的新YouTube视频数据集上,大幅优于当前最先进水平(包括顶尖的ConvNet方法)。此外,我们表明利用自动生成的标注进行训练可提升通用ConvNet在其他基准上的性能。
引用
@article{arxiv.1511.06676,
title = {Personalizing Human Video Pose Estimation},
author = {James Charles and Tomas Pfister and Derek Magee and David Hogg and Andrew Zisserman},
journal= {arXiv preprint arXiv:1511.06676},
year = {2016}
}
备注
CVPR 2016