MaskHOI:基于掩码预训练的鲁棒3D手-物交互估计
计算机视觉与模式识别
2025-07-21 v1
摘要
在3D手-物交互(HOI)任务中,由于RGB图像固有的几何歧义以及交互期间发生的严重互相遮挡,单摄像头RGB输入下精确估计手部和物体的关节位置极具挑战性。为此,我们提出了MaskHOI,一种新颖的基于掩码自编码器(MAE)驱动的预训练框架,以增强HOI姿态估计。我们的核心思想是利用MAE的掩码-重构策略,鼓励特征编码器推断缺失的空间和结构信息,从而促进几何感知和对遮挡鲁棒的特征学习。具体而言,基于我们发现人类手部的几何复杂度远大于刚性物体的观察,常规的均匀掩码无法有效指导细粒度手部结构的重构。为克服这一局限,我们引入了区域特定掩码比率分配,主要包括区域特定掩码分配和骨架驱动的手部掩码引导。前者自适应地将手部区域的掩码比率设置为低于刚性物体的值,以平衡它们的特征学习难度;后者优先对关键手部部位(如指尖或整只手指)进行掩码,以真实模拟实际交互中的遮挡模式。此外,为增强预训练编码器的几何感知能力,我们引入了新颖的掩码符号距离场(SDF)驱动的多模态学习机制。通过自掩码3D SDF预测,学习到的编码器能够感知手部和物体的全局几何结构,超越2D图像平面,克服单目输入的固有局限性,缓解自遮挡问题。广泛的实验表明,我们的方法显著优于现有最先进的方法。
引用
@article{arxiv.2507.13673,
title = {MaskHOI: Robust 3D Hand-Object Interaction Estimation via Masked Pre-training},
author = {Yuechen Xie and Haobo Jiang and Jian Yang and Yigong Zhang and Jin Xie},
journal= {arXiv preprint arXiv:2507.13673},
year = {2025}
}
备注
10 pages, 8 figures, 6 tables