显式框检测统一端到端多人姿态估计
计算机视觉与模式识别
2023-02-06 v1
摘要
本文提出一种新颖的带显式框检测 (Explicit box Detection) 的端到端多人姿态估计框架,称为 ED-Pose,其统一了人体级(全局)与关键点级(局部)信息间的上下文学习。与以往单阶段方法不同,ED-Pose 将此任务重新视为两个具统一表示与回归监督的显式框检测过程。首先,我们引入一个从编码 token 提取全局特征的人体检测解码器,它可为后续关键点检测提供良好初始化,使训练过程快速收敛。其次,为引入关键点附近的上下文信息,我们将姿态估计视为关键点框检测问题,以学习每个关键点的框位置与内容。人体到关键点检测解码器采用人体与关键点特征间的交互学习策略,进一步增强全局与局部特征聚合。总体而言,ED-Pose 概念简洁,无需后处理与密集热图监督。相比两阶段与单阶段方法,它展现了有效性与高效性。值得注意的是,显式框检测在 COCO 上提升姿态估计性能 4.5 AP,在 CrowdPose 上提升 9.9 AP。作为具有 L1 回归损失的完全端到端框架,ED-Pose 首次在相同骨干网下以 1.2 AP 超越基于热图的 Top-down 方法,并在无任何额外技巧的情况下以 76.6 AP 在 CrowdPose 上取得最先进 (state-of-the-art) 性能。代码见 https://github.com/IDEA-Research/ED-Pose。
引用
@article{arxiv.2302.01593,
title = {Explicit Box Detection Unifies End-to-End Multi-Person Pose Estimation},
author = {Jie Yang and Ailing Zeng and Shilong Liu and Feng Li and Ruimao Zhang and Lei Zhang},
journal= {arXiv preprint arXiv:2302.01593},
year = {2023}
}
备注
Accepted to ICLR 2023