HandMIM:面向三维手部网格估计的姿态感知自监督学习
计算机视觉与模式识别
2023-08-01 v1
摘要
随着随时间产生的大量手部图像,从未经标注的图像中释放姿态知识以用于有监督的手部网格估计是一个新兴但具有挑战性的课题。为缓解该问题,已有半监督和自监督方法被提出,但它们受限于对检测模型或常规ResNet骨干网络的依赖。本文受掩码图像建模(MIM)在视觉分类任务中快速发展的启发,提出了一种用于回归三维手部网格参数的新颖自监督预训练策略。我们的方法包含统一且多粒度的策略,包括在师生框架中用于学习姿态感知语义类令牌的伪关键点对齐模块。对于具有详细局部性的补丁令牌,我们基于MIM预训练采用师生网络间的自蒸馏方式。为更好地适配低层回归任务,我们引入像素重建任务以进行多级表示学习。此外,我们设计了一个强大的姿态估计基线,使用简单的vanilla视觉Transformer(ViT)作为骨干网络,并在令牌后接PyMAF头用于回归。大量实验表明,我们提出的方法HandMIM在各种手部网格估计任务上取得了强劲性能。值得注意的是,HandMIM优于专门优化的架构,在具有挑战性的FreiHAND和HO3Dv2测试集上分别实现了6.29mm和8.00mm的PAVPE(顶点-点误差),确立了三维手部网格估计上的新SOTA记录。
引用
@article{arxiv.2307.16061,
title = {HandMIM: Pose-Aware Self-Supervised Learning for 3D Hand Mesh Estimation},
author = {Zuyan Liu and Gaojie Lin and Congyi Wang and Min Zheng and Feida Zhu},
journal= {arXiv preprint arXiv:2307.16061},
year = {2023}
}