中文

TransPose:基于 Transformer 的关键点定位

计算机视觉与模式识别 2021-09-02 v5

摘要

尽管基于 CNN 的模型在人体姿态估计方面取得了显著进展,但它们捕获了何种空间依赖关系以定位关键点仍不清楚。在本工作中,我们提出了一个名为 \textbf{TransPose} 的模型,该模型将 Transformer 引入人体姿态估计。Transformer 中构建的注意力层使我们的模型能够高效捕获长程关系,同时也能揭示预测关键点所依赖的关系。为了预测关键点热图,最后一个注意力层充当聚合器,收集来自图像线索的贡献并形成关键点的最大位置。这种基于 Transformer 的热图定位方法符合激活最大化原则~\cite{erhan2009visualizing}。并且揭示出的依赖关系是特定于图像且细粒度的,这也能为模型如何处理特殊情况(例如遮挡)提供证据。实验表明,TransPose 在 COCO 验证集和 test-dev 集上分别达到了 75.8 AP 和 75.0 AP,同时比主流 CNN 架构更轻量、更快速。TransPose 模型在 MPII 基准上也具有很好的迁移能力,在以少量训练成本进行微调时,在测试集上取得了优异的性能。代码和预训练模型已公开\footnote{\url{https://github.com/yangsenius/TransPose}}。

关键词

引用

@article{arxiv.2012.14214,
  title  = {TransPose: Keypoint Localization via Transformer},
  author = {Sen Yang and Zhibin Quan and Mu Nie and Wankou Yang},
  journal= {arXiv preprint arXiv:2012.14214},
  year   = {2021}
}

备注

Accepted by ICCV 2021