中文

聚焦低分辨率信息:用于低分辨率人体姿态估计的多粒度信息无损模型

计算机视觉与模式识别 2024-05-22 v1

摘要

在人体姿态估计的实际应用中,当图像采集设备性能受限或拍摄距离过远时,经常会遇到低分辨率输入图像。然而,现有的人体姿态估计 SOTA 模型在低分辨率图像上表现不佳。一个关键原因是这些模型中存在下采样层,例如步幅卷积和池化层。这进一步减少了本已不足的图像信息。另一个关键原因是人体骨架和人体运动学信息未被充分利用。在这项工作中,我们提出了一种多粒度信息无损模型来替代下采样层,以解决上述问题。具体而言,MGIL 采用了细粒度无损信息提取模块,可以防止局部信息的丢失。此外,我们设计了一个粗粒度信息交互模块,以充分利用人体结构信息。为了高效融合跨粒度信息并彻底挖掘关键点之间的关系,我们进一步引入了多粒度自适应融合机制。该机制根据图像内容为不同粒度的特征分配权重。该模型有效、灵活且通用。我们通过综合实验展示了其在各种视觉任务中的潜力。它在 COCO 上比 SOTA 方法高出 7.7 mAP,并且在不同的输入分辨率、不同的主干网络和不同的视觉任务中表现良好。代码在补充材料中提供。

关键词

引用

@article{arxiv.2405.12247,
  title  = {Focus on Low-Resolution Information: Multi-Granular Information-Lossless Model for Low-Resolution Human Pose Estimation},
  author = {Zejun Gu and Zhong-Qiu Zhao and Hao Shen and Zhao Zhang},
  journal= {arXiv preprint arXiv:2405.12247},
  year   = {2024}
}

备注

8 pages, 5 figures, conference