引入稀疏性的改进 TokenPose
计算机视觉与模式识别
2023-11-17 v1
摘要
过去几年中,视觉 transformer 及其各种形式在人体姿态估计中变得日益重要。通过将图像块视为 token,transformer 能够明智地捕捉全局关系,利用视觉 token 估计关键点 token,并识别人体姿态。然而,全局注意力计算开销大,这给将基于 transformer 的方法扩展到高分辨率特征带来了挑战。本文中,我们在关键点 token 注意力和视觉 token 注意力中均引入稀疏性,以改进人体姿态估计。在 MPII 数据集上的实验结果表明,我们的模型具有更高的精度,并证明了该方法的可行性,取得了新的最先进(SOTA)结果。该思路也可为其他基于 transformer 的模型提供参考。
引用
@article{arxiv.2311.09653,
title = {Improved TokenPose with Sparsity},
author = {Anning Li},
journal= {arXiv preprint arXiv:2311.09653},
year = {2023}
}