中文

DETRPose:用于多人姿态估计的实时端到端Transformer模型

计算机视觉与模式识别 2025-06-17 v1

摘要

多人姿态估计(MPPE)估计图像中所有个体的关键点。MPPE是计算机视觉和虚拟现实中若干应用的基础任务。不幸的是,目前尚无能够实时执行MPPE的基于Transformer的模型。本文提出了一系列能够实时执行多人2D姿态估计的基于Transformer的模型。我们的方法利用改进的解码器架构和关键点相似度度量来生成正查询和负查询,从而增强架构中所选查询的质量。与最先进模型相比,所提出的模型训练速度快得多,使用的epoch数少5到10倍,推理时间具有竞争力,且无需量化库来加速模型。此外,所提出的模型在参数显著更少的情况下,提供了具有竞争力的结果或优于替代模型。

关键词

引用

@article{arxiv.2506.13027,
  title  = {DETRPose: Real-time end-to-end transformer model for multi-person pose estimation},
  author = {Sebastian Janampa and Marios Pattichis},
  journal= {arXiv preprint arXiv:2506.13027},
  year   = {2025}
}