Pi-HOC:成对3D人体-物体接触估计
计算机视觉与模式识别
2026-05-13 v2
摘要
解析图像中的真实世界人体-物体交互是一个多对多的挑战,其中解开细粒度的并发物理接触尤为困难。现有的语义接触估计方法要么局限于单人场景,要么除了输入图像外还需要物体几何信息(例如网格)。当前最先进的方法利用强大的VLM进行类别级语义理解,但在多人场景中表现不佳,且推理时扩展性差。我们引入了Pi-HOC,一个用于所有人体-物体对的密集3D语义接触预测的单次、实例感知框架。Pi-HOC检测实例,为每一对创建专用的人体-物体(HO)标记,并使用InteractionFormer对其进行精炼。然后,一个基于SAM的解码器为每个人体-物体对在SMPL人体网格上预测密集接触。在MMHOI和DAMON数据集上,Pi-HOC在准确性和定位方面显著优于最先进的方法,同时实现了20倍的吞吐量提升。我们进一步证明,预测的接触通过一种测试时优化算法改进了SAM-3D图像到网格的重建,并且无需额外训练即可实现基于语言查询的指代性接触预测。
引用
@article{arxiv.2604.12923,
title = {Pi-HOC: Pairwise 3D Human-Object Contact Estimation},
author = {Sravan Chittupalli and Ayush Jain and Dong Huang},
journal= {arXiv preprint arXiv:2604.12923},
year = {2026}
}