HRPVT:面向中小尺度人体姿态估计的高分辨率金字塔视觉Transformer
计算机视觉与模式识别
2024-12-17 v1
摘要
中小尺度的人体姿态估计长期以来一直是该领域的一个重大挑战。大多数现有方法侧重于通过堆叠多个代价高昂的反卷积层,或在保持高分辨率特征图的同时不断聚合来自低分辨率特征图的语义信息来恢复高分辨率特征图,但这可能导致信息冗余。此外,由于量化误差,基于热图的方法在准确定位中小尺度人体关键点方面存在某些劣势。在本文中,我们提出了 HRPVT,它利用 PVT v2 作为骨干网络来建模长距离依赖关系。在此基础上,我们引入了高分辨率金字塔模块(HRPM),该模块旨在通过将卷积神经网络(CNN)固有的归纳偏置引入高分辨率特征图,生成更高质量的高分辨率表示。HRPM 的集成增强了纯基于 Transformer 的模型在中小尺度人体姿态估计上的性能。此外,我们用 SimCC 方法替代了基于热图的方法,从而消除了对代价高昂的上采样层的需求,使我们能够将更多的计算资源分配给 HRPM。为了适应不同参数规模的模型,我们开发了两种 HRPM 的插入策略,每种策略都旨在从两个不同的角度增强模型感知中小尺度人体姿态的能力。
引用
@article{arxiv.2410.22079,
title = {HRPVT: High-Resolution Pyramid Vision Transformer for medium and small-scale human pose estimation},
author = {Zhoujie Xu},
journal= {arXiv preprint arXiv:2410.22079},
year = {2024}
}
备注
under review