VPHO:面向手-物体姿态估计的联合视觉-物理线索学习与聚合
计算机视觉与模式识别
2025-11-18 v1
摘要
从单张 RGB 图像估计手部和物体的 3D 姿态是一项基础且具有挑战性的问题,在增强现实和人机交互领域具有广泛应用。现有方法主要依赖视觉线索,常常产生违反物理约束(如穿透或非接触)的结果。近期尝试引入物理推理,通常依赖后处理或非可微分物理引擎,这会牺牲视觉一致性和端到端可训练性。为克服这些限制,我们提出一种新框架,联合集成视觉和物理线索进行手-物体姿态估计。该集成通过两种关键思想实现:1)联合视觉-物理线索学习:模型在提取 2D 视觉线索和 3D 物理线索的同时进行训练,从而实现对手-物体相互作用的更全面表征学习;2)候选姿态聚合:一种新颖的细化过程,通过利用视觉和物理预测,对多个扩散生成的候选姿态进行聚合,生成最终估计,使其在视觉上一致且在物理上合理。大量实验表明,我们的方法在姿态精度和物理合理性方面显著优于现有 SOTA 方法。
引用
@article{arxiv.2511.12030,
title = {VPHO: Joint Visual-Physical Cue Learning and Aggregation for Hand-Object Pose Estimation},
author = {Jun Zhou and Chi Xu and Kaifeng Tang and Yuting Ge and Tingrui Guo and Li Cheng},
journal= {arXiv preprint arXiv:2511.12030},
year = {2025}
}
备注
14 pages, 9 figures, extended version of the AAAI 2026 paper "VPHO: Joint Visual-Physical Cue Learning and Aggregation for Hand-Object Pose Estimation"