用于实时三维人体姿态估计与动作识别的多任务深度学习
计算机视觉与模式识别
2020-03-05 v2
摘要
人体姿态估计与动作识别是相关任务,因为两个问题都强烈依赖于人体表示与分析。尽管如此,文献中多数近期方法分别处理这两个问题。本工作中,我们提出一个多任务框架,用于从单目彩色图像联合估计 2D 或 3D 人体姿态,并从视频序列分类人体动作。我们展示单一架构可高效解决两个问题,且在各任务上仍取得 SOTA 或可比结果,同时以超过 100 帧每秒运行。所提方法通过统一静止图像与视频片段处理于单一流水线中,受益于两任务间的高参数共享,允许模型以无缝方式同时用不同类别数据训练。此外,我们通过解耦关键预测部分,为端到端训练所提多任务模型提供了重要见解,这持续带来两任务上更好的精度。在四个数据集(MPII、Human3.6M、Penn Action 与 NTU RGB+D)上报告的结果证明了我们方法在目标任务上的有效性。我们的源代码与训练权重公开于 https://github.com/dluvizon/deephar。
引用
@article{arxiv.1912.08077,
title = {Multi-task Deep Learning for Real-Time 3D Human Pose Estimation and Action Recognition},
author = {Diogo C Luvizon and Hedi Tabia and David Picard},
journal= {arXiv preprint arXiv:1912.08077},
year = {2020}
}
备注
Accepted to TPAMI. arXiv admin note: text overlap with arXiv:1802.09232