基于激光雷达点云的 3D 人体姿态估计中的人体-物体交互学习
计算机视觉与模式识别
2026-03-18 v1
摘要
从激光雷达点云中理解人类的任务在自动驾驶领域至关重要,因为它与行人安全密切相关,但在存在多样化的人体-物体交互和杂乱背景时仍然具有挑战性。然而,现有方法在很大程度上忽略了利用人体-物体交互来构建稳健的 3D 人体姿态估计框架的潜力。促使我们引入人体-物体交互,有两个主要挑战:首先,人体-物体交互在人类与物体点之间引入了空间歧义,常导致交互区域的 3D 人体关键点预测错误;其次,在交互和非交互身体部位之间的点数存在严重的类别不平衡,其中如手和脚等交互频繁区域在激光雷达数据中观察到的点稀少。为解决这些挑战,我们提出了一种用于从激光雷达点云进行稳健 3D 人体姿态估计的人体-物体交互学习(Human-Object Interaction Learning, HOIL)框架。为缓解空间歧义问题,我们提出了人体-物体交互感知对比学习(Human-Object Interaction-aware Contrastive Learning, HOICL),有效增强了交互区域人类与物体点之间的特征判别性。为缓解类别不平衡问题,我们引入接触感知部件引导式池化(Contact-aware Part-guided Pooling, CPool),通过压缩过度代表的点,同时保留来自交互身体部位的有用信息来实现代表性容量的自适应重新分配。此外,我们提出了一种可选的基于接触的时序细化方法,通过时序中的接触线索来细化每帧关键点估计。结果表明,我们的 HOIL 有效地利用了人体-物体交互,以解决交互区域的空间歧义和类别不平衡问题。将发布代码。
引用
@article{arxiv.2603.16343,
title = {Learning Human-Object Interaction for 3D Human Pose Estimation from LiDAR Point Clouds},
author = {Daniel Sungho Jung and Dohee Cho and Kyoung Mu Lee},
journal= {arXiv preprint arXiv:2603.16343},
year = {2026}
}
备注
Project page: https://hoil-release.github.io/