GRACE: 从2D图像估计几何级3D人体-场景接触
计算机视觉与模式识别
2025-05-13 v1
摘要
估计几何级的人体-场景接触旨在将特定接触表面点定位在3D人体几何上,这提供了空间先验并桥接了人体与场景之间的交互,支持人体行为分析、具身AI和AR/VR等应用。为完成该任务,现有方法主要依赖参数化人体模型(如SMPL),通过固定的SMPL顶点序列建立图像与接触区域之间的对应关系。这实际上完成了从图像特征到有序序列的映射。然而,该方法缺乏对几何的考虑,限制了其在不同人体几何上的泛化能力。在本文中,我们提出了GRACE(Geometry-level Reasoning for 3D Human-scene Contact Estimation),一种新的3D人体接触估计范式。GRACE结合了点云编码器-解码器架构以及层次化特征提取与融合模块,实现了3D人体几何结构与从图像中提取的2D交互语义的有效集成。在视觉线索的引导下,GRACE建立了从几何特征到3D人体网格顶点空间的隐式映射,从而实现了对接触区域的精确建模。该设计确保了高预测精度,并赋予框架在多样化人体几何上强大的泛化能力。在多个基准数据集上的广泛实验表明,GRACE在接触估计上达到了最先进的性能,额外的结果进一步验证了其对非结构化人体点云的鲁棒泛化能力。
引用
@article{arxiv.2505.06575,
title = {GRACE: Estimating Geometry-level 3D Human-Scene Contact from 2D Images},
author = {Chengfeng Wang and Wei Zhai and Yuhang Yang and Yang Cao and Zhengjun Zha},
journal= {arXiv preprint arXiv:2505.06575},
year = {2025}
}