中文

Group Pose:一种用于端到端多人姿态估计的简单基线

计算机视觉与模式识别 2023-08-15 v1

摘要

本文研究端到端多人姿态估计问题。当前最优方案采用类 DETR 框架,主要设计复杂解码器,例如 ED-Pose 将姿态估计视为关键点框检测并与人体检测结合,PETR 使用姿态解码器与关节(关键点)解码器分层预测。我们提出一种简洁而高效的 transformer 方法,名为 Group Pose。我们简单地将 KK 关键点姿态估计视为预测一组 N×KN\times K 个关键点位置(各由一个关键点查询预测),并以一个实例查询表示每个姿态用于对 NN 个姿态预测打分。受“不同类型跨实例查询间的交互无直接助益”这一直觉启发,我们对解码器自注意力做了简单修改:将以所有 N×(K+1)N\times(K+1) 个查询为对象的单一自注意力,替换为两次后续的分组自注意力:(i) NN 次实例内自注意力,每次作用于 KK 个关键点查询与一个实例查询;(ii) (K+1)(K+1) 次同类型跨实例自注意力,每次作用于 NN 个同类型查询。所得解码器去除了跨实例不同类型查询间的交互,简化了优化从而提升性能。在 MS COCO 与 CrowdPose 上的实验表明,我们无需人体框监督的方法优于此前带复杂解码器的方法,甚至略优于使用人体框监督的 ED-Pose。\href\href{https://github.com/Michel-liu/GroupPose-Paddle}{\rm Paddle}\href\href{https://github.com/Michel-liu/GroupPose}{\rm PyTorch} 代码已公开。

关键词

引用

@article{arxiv.2308.07313,
  title  = {Group Pose: A Simple Baseline for End-to-End Multi-person Pose Estimation},
  author = {Huan Liu and Qiang Chen and Zichang Tan and Jiang-Jiang Liu and Jian Wang and Xiangbo Su and Xiaolong Li and Kun Yao and Junyu Han and Errui Ding and Yao Zhao and Jingdong Wang},
  journal= {arXiv preprint arXiv:2308.07313},
  year   = {2023}
}

备注

Accepted by ICCV 2023