中文

SiMHand:从野外手部图像中挖掘相似手部特征用于大规模3D手姿预训练

计算机视觉与模式识别 2025-05-06 v3

摘要

我们提出了一个用于从野外手部图像中进行3D手姿估计的预训练框架,称为SimHand。大规模图像预训练在各种任务中均取得了令人期待的结果,但现有的3D手姿预训练方法尚未充分利用来自野外视频中可获得的多样化手部图像的潜力。为实现可扩展的预训练,我们首先从野外视频中收集一大批手部图像,并设计了基于对比学习的预训练方法。具体而言,我们从近期的人类中心视频(如100DOH和Ego4D)中收集超过200万张手部图像。为从这些图像中提取判别性信息,我们关注手部的相似性:来自相似手姿的非相同样本对。我们提出了一种新颖的对比学习方法,将相似的手部配对在特征空间中嵌入得更靠近。该方法不仅从相似样本中学习,还能根据样本间距离自适应地对对比学习损失进行加权,从而获得额外的性能提升。我们的实验结果表明,本方法优于仅使用单张图像通过数据增强生成正样本对的常规对比学习方法。在多个数据集上,我们相较于最新方法(PeCLR)取得了显著改进,分别在FreiHand、DexYCB和AssemblyHands上提升了15%、10%和4%。我们的代码已公开:https://github.com/ut-vision/SiMHand。

关键词

引用

@article{arxiv.2502.15251,
  title  = {SiMHand: Mining Similar Hands for Large-Scale 3D Hand Pose Pre-training},
  author = {Nie Lin and Takehiko Ohkawa and Yifei Huang and Mingfang Zhang and Minjie Cai and Ming Li and Ryosuke Furuta and Yoichi Sato},
  journal= {arXiv preprint arXiv:2502.15251},
  year   = {2025}
}

备注

ICLR 2025. arXiv admin note: text overlap with arXiv:2409.09714