中文

视频中人体姿态估计的框架

计算机视觉与模式识别 2016-04-27 v1

摘要

在本文中,我们提出一种在非约束视频中估计人体姿态序列的方法。我们旨在证明,利用时间信息,人体姿态估计结果可优于基于图像的姿态估计方法。与通常采用且为 NP-hard 并需要近似解的图优化公式不同,我们将该问题表述为一个统一的基于树的两阶段优化问题,其存在高效且精确的求解。尽管所提方法求得精确解,它并未牺牲对帧内身体部位间时空约束建模的能力;事实上,它对对称部位的建模优于现有方法。该方法基于两个主要思想:“抽象”(Abstraction)与“关联”(Association),以在不增加多项式时间解额外计算复杂度的情况下强制帧内与帧间身体部位约束。利用“抽象”思想,引入“抽象身体部位”新概念,在概念上组合对称身体部位并在基于树的身体部位结构中建模。利用“关联”思想,为每个抽象身体部位生成最优轨迹段(tracklet),以强制相邻帧间身体部位的时空约束。通过基于树的优化从抽象身体部位轨迹段推断出最佳姿态序列。最后,通过肢体对齐与细化方案对姿态进行精炼。我们在三个公开可用的基于视频的人体姿态估计数据集上评估了所提方法,相比最先进(SOTA)方法取得了显著改进的性能。

关键词

引用

@article{arxiv.1604.07788,
  title  = {A Framework for Human Pose Estimation in Videos},
  author = {Dong Zhang and Mubarak Shah},
  journal= {arXiv preprint arXiv:1604.07788},
  year   = {2016}
}