中文

MMHOI:建模复杂3D多人多物体交互

计算机视觉与模式识别 2025-12-05 v3

摘要

现实场景常常包含多个人以因果、目标导向或合作方式与多个物体进行交互。然而,现有的3D人物-物体交互(HOI)基准只涵盖这些复杂交互的一部分。为弥合这一差距,我们提出了MMHOI——一个大规模、多人多物体交互数据集,包含来自12种日常场景的图像。MMHOI提供每个人和物体的完整3D形状和姿态标注,以及78个动作类别和14个交互特定部位的标签,为下一代HOI研究提供了全面的测试平台。基于MMHOI,我们提出了MMHOI-Net,一个基于transformer的端到端神经网络,用于联合估计人物-物体3D几何、它们的交互以及相关动作。我们框架的关键创新是一种用于建模物体及其交互的结构化双补丁表示,结合动作识别以增强交互预测。在MMHOI和最近提出的CORE4D数据集上的实验表明,我们的方法在多HOI建模方面实现了最高的性能,在准确率和重建质量方面均表现出色。MMHOI数据集已公开提供,网址为 https://zenodo.org/records/17711786。

关键词

引用

@article{arxiv.2510.07828,
  title  = {MMHOI: Modeling Complex 3D Multi-Human Multi-Object Interactions},
  author = {Kaen Kogashi and Anoop Cherian and Meng-Yu Jennifer Kuo},
  journal= {arXiv preprint arXiv:2510.07828},
  year   = {2025}
}

备注

Accepted to WACV 2026