中文

层次化视觉基础模型用于低成本人体网格恢复与姿态估计

计算机视觉与模式识别 2025-11-18 v2

摘要

本文旨在开发用于人体网格恢复(HMR)及其前驱任务——人体姿态估计(HPE)的简单且高效模型。最新方法如 HMR2.0 及其后续版本依赖于大型非层次化视觉变换器作为编码器,这些编码器继承自相应的 HPE 模型(如 ViTPose)。为在不同计算预算下建立基线,我们首先通过改编相应的 ViTPose 模型构建了三个轻量级 HMR2.0 变体。此外,我们提出利用层次化视觉基础模型(VFM)的早期阶段作为编码器,包括 Swin Transformer、GroupMixFormer 和 VMamba。这种设计源于观察:层次化 VFM 的中间阶段生成的特征图分辨率与或超过非层次化模型。我们对 27 个基于层次化 VFM 的 HMR 与 HPE 模型进行了全面评估,结果表明仅使用前两或三阶段即可达到完整阶段模型的性能。而且,我们展示了所得截断模型在准确率与计算效率之间具有更好的权衡,优于现有轻量级替代方案。源码已公开于 https://github.com/nttcom/TruncHierVFM。

关键词

引用

@article{arxiv.2510.12660,
  title  = {On the Use of Hierarchical Vision Foundation Models for Low-Cost Human Mesh Recovery and Pose Estimation},
  author = {Shuhei Tarashima and Yushan Wang and Norio Tagawa},
  journal= {arXiv preprint arXiv:2510.12660},
  year   = {2025}
}

备注

Accepted at ICCVW 2025. Code: https://github.com/nttcom/TruncHierVFM