中文

VideoAfford:基于多模态大语言模型从人物-物体-互动视频中对齐 3D 功能

计算机视觉与模式识别 2026-02-11 v1

摘要

3D 功能对齐旨在在 3D 物体上标记可操作区域,这对于机器人操作至关重要。以往的研究主要从静态线索(如语言和图像)中学习功能知识,难以提供充足的动态交互背景以揭示时间和因果线索。为缓解这一困境,我们收集了一个全面的基于视频的 3D 功能数据集「VIDA」,包含 38K 条人物-物体-互动视频,覆盖 16 种功能类型、38 种物体类别和 22K 个点云。基于「VIDA」,我们提出了一个强大的基线:VideoAfford,通过增加功能分割能力,使多模态大语言模型能够在统一框架内进行世界知识推理和精细的功能对齐。为增强动作理解能力,我们利用潜在动作编码器从 HOI 视频中提取动态交互先验。此外,我们引入一种「空间感知」损失函数,使 VideoAfford 能够获得完整的 3D 空间知识。广泛的实验评估表明,我们的模型显著优于既定方法,并在功能推理方面表现出强大的开放世界泛化能力。所有数据集和代码将公开发布,以推动该领域的研究。

关键词

引用

@article{arxiv.2602.09638,
  title  = {VideoAfford: Grounding 3D Affordance from Human-Object-Interaction Videos via Multimodal Large Language Model},
  author = {Hanqing Wang and Mingyu Liu and Xiaoyu Chen and Chengwei MA and Yiming Zhong and Wenti Yin and Yuhao Liu and Zhiqing Cui and Jiahao Yuan and Lu Dai and Zhiyuan Ma and Hui Xiong},
  journal= {arXiv preprint arXiv:2602.09638},
  year   = {2026}
}