GenHOI:基于遮挡感知的通用手-物体姿态估计
计算机视觉与模式识别
2026-03-31 v3
摘要
从单张RGB图像进行3D手-物体姿态估计仍具有挑战性,尤其是在物体外观和相互作用模式存在较大变异且遭遇重度遮挡时。我们提出GenHOI,一个具备遮挡感知能力的通用手-物体姿态估计框架。GenHOI整合了层次化语义知识与手部先验知识,以增强模型在恶劣遮挡条件下的泛化能力。具体而言,我们引入层次化语义提示,通过文本描述对物体状态、手部配置和相互作用模式进行编码。这使模型能够学习手-物体相互作用的抽象高层表征,以实现对未见物体和新型相互作用的泛化,同时弥补缺失或模糊视觉线索的不足。为实现稳健的遮挡推理,我们采用RGB图像、预测点云和文本描述上的多模态掩码建模策略。此外,我们利用手部先验作为稳定的空间参考,以提取隐式的相互作用约束。这允许即使在物体形状和相互作用模式发生显著变化的情况下,仍能可靠地进行姿态推断。在挑战性的DexYCB和HO3Dv2基准测试上进行大量实验表明,我们的方法在手-物体姿态估计方面实现了最先进的性能。
引用
@article{arxiv.2603.19013,
title = {GenHOI: Generalized Hand-Object Pose Estimation with Occlusion Awareness},
author = {Hui Yang and Wei Sun and Jian Liu and Jian Xiao and Tao Xie and Hossein Rahmani and Ajmal Saeed Mian and Nicu Sebe and Gim Hee Lee},
journal= {arXiv preprint arXiv:2603.19013},
year = {2026}
}
备注
25 pages, 7 figures