基于深度图像的高效卷积神经网络多人姿态估计
计算机视觉与模式识别
2019-12-03 v1
摘要
实现鲁棒的多人 2D 身体关键点定位与姿态估计,对于理解人类行为与交互(例如人机交互场景中所遇到的)至关重要。近来已提出一些准确的方法,但它们通常依赖于较深的卷积神经网络(CNN)架构,因而需要大量的计算与训练资源。本文中,我们研究不同的架构与方法以解决这些问题,实现快速且准确的多人 2D 姿态估计。为促进速度,我们提出使用深度图像,其结构包含关于身体关键点的充足信息,同时比纹理彩色图像更简单,从而潜在地需要较不复杂的 CNN 进行处理。在此背景下,我们做出如下贡献:i) 我们研究了若干 CNN 架构设计,将依赖于检测器级联概念的姿态机与轻量高效 CNN 结构相结合;ii) 为解决具有高可变性的大规模训练数据集需求,我们采用结合多人合成深度数据与真实传感器背景的半合成数据;iii) 我们探索域适应技术以解决在真实深度图像上测试所引入的性能差距;iv) 为提升我们快速轻量 CNN 模型的准确性,我们在多个架构层级上研究知识蒸馏,其有效增强了性能。在合成与真实数据上的实验与结果凸显了我们设计选择的影响,为应对实际应用通常面临的标准问题的方法提供了见解,并得到了在性能与速度上均有效契合我们目标的架构。
引用
@article{arxiv.1912.00711,
title = {Efficient Convolutional Neural Networks for Depth-Based Multi-Person Pose Estimation},
author = {Angel Martínez-González and Michael Villamizar and Olivier Canévet and Jean-Marc Odobez},
journal= {arXiv preprint arXiv:1912.00711},
year = {2019}
}
备注
Published in IEEE TRANSACTIONS ON CIRCUITS AND SYSTEMS FOR VIDEO TECHNOLOGY