中文

用于人体姿态估计的简单多分辨率表示学习

计算机视觉与模式识别 2021-01-25 v2 图像与视频处理

摘要

人体姿态估计——在给定图像中识别人体关键点的过程——是计算机视觉中最重要的任务之一,并具有包括运动诊断、监控或自动驾驶车辆在内的广泛应用。得益于深度学习的蓬勃发展,人体关键点预测的准确率正不断提高。大多数现有方法通过生成热图来解决人体姿态估计,其中第i个热图表示第i个关键点的位置置信度。在本文中,我们引入称为多分辨率表示学习的新颖网络结构用于人体关键点预测。在学习过程的不同分辨率下,我们的网络分支并使用额外层来学习热图生成。我们首先考虑在获得最低分辨率特征图之后生成多分辨率热图的架构。我们的第二种方法允许在特征提取过程中学习,其中热图在特征提取器的每个分辨率下生成。第一种和第二种方法分别称为多分辨率热图学习和多分辨率特征图学习。我们的架构简单而有效,取得了良好性能。我们在两个常用的人体姿态估计基准上进行了实验:MSCOCO和MPII数据集。代码已在 https://github.com/tqtrunghnvn/SimMRPose 公开可用。

关键词

引用

@article{arxiv.2004.06366,
  title  = {Simple Multi-Resolution Representation Learning for Human Pose Estimation},
  author = {Trung Q. Tran and Giang V. Nguyen and Daeyoung Kim},
  journal= {arXiv preprint arXiv:2004.06366},
  year   = {2021}
}