中文

VAGNet:从人类-物体交互中对 3D 物体可触性进行基准化

计算机视觉与模式识别 2026-02-25 v1

摘要

3D 物体可触性基准化旨在识别支持人类-物体交互 (HOI) 的 3D 物体区域,这是具象化视觉推理所必需的能力。然而,大多数现有方法依赖静态视觉或文本线索,忽视了可触性本质上由动态动作定义的事实,导致它们往往难以定位真实交互中涉及的接触区域。我们采取不同的视角。人类通过观察和模仿动作来学习如何使用物体,而不仅仅是检查其形状。以此为动机,我们提出了受视频驱动的 3D 可触性基准化,利用动态交互序列提供功能性监督。为实现这一目标,我们提出了 VAGNet 框架,将视频派生的交互线索与 3D 结构对齐,以解决静态线索无法解决的歧义。为支持这一新设定,我们引入了 PVAD,即首个 HOI 视频-3D 配对可触性数据集,提供先前工作中不可获得的功能性监督。大量实验表明,VAGNet 在 PVAD 上实现了最新的性能,显著优于基于静态线索的基线方法。该代码和数据集将公开 release。

关键词

引用

@article{arxiv.2602.20608,
  title  = {VAGNet: Grounding 3D Affordance from Human-Object Interactions in Videos},
  author = {Aihua Mao and Kaihang Huang and Yong-Jin Liu and Chee Seng Chan and Ying He},
  journal= {arXiv preprint arXiv:2602.20608},
  year   = {2026}
}