Group Pose:一种用于端到端多人姿态估计的简单基线
计算机视觉与模式识别
2023-08-15 v1
摘要
本文研究端到端多人姿态估计问题。当前最优方案采用类 DETR 框架,主要设计复杂解码器,例如 ED-Pose 将姿态估计视为关键点框检测并与人体检测结合,PETR 使用姿态解码器与关节(关键点)解码器分层预测。我们提出一种简洁而高效的 transformer 方法,名为 Group Pose。我们简单地将 关键点姿态估计视为预测一组 个关键点位置(各由一个关键点查询预测),并以一个实例查询表示每个姿态用于对 个姿态预测打分。受“不同类型跨实例查询间的交互无直接助益”这一直觉启发,我们对解码器自注意力做了简单修改:将以所有 个查询为对象的单一自注意力,替换为两次后续的分组自注意力:(i) 次实例内自注意力,每次作用于 个关键点查询与一个实例查询;(ii) 次同类型跨实例自注意力,每次作用于 个同类型查询。所得解码器去除了跨实例不同类型查询间的交互,简化了优化从而提升性能。在 MS COCO 与 CrowdPose 上的实验表明,我们无需人体框监督的方法优于此前带复杂解码器的方法,甚至略优于使用人体框监督的 ED-Pose。 与 代码已公开。
引用
@article{arxiv.2308.07313,
title = {Group Pose: A Simple Baseline for End-to-End Multi-person Pose Estimation},
author = {Huan Liu and Qiang Chen and Zichang Tan and Jiang-Jiang Liu and Jian Wang and Xiangbo Su and Xiaolong Li and Kun Yao and Junyu Han and Errui Ding and Yao Zhao and Jingdong Wang},
journal= {arXiv preprint arXiv:2308.07313},
year = {2023}
}
备注
Accepted by ICCV 2023