从图像中的 2D 交互定位 3D 物体可供性
计算机视觉与模式识别
2023-08-10 v2
摘要
定位 3D 物体可供性旨在定位物体 3D 空间中的“动作可能性”区域,作为具身智能体感知与操作间的桥梁。现有研究主要关注将视觉可供性与几何结构相连,例如依赖标注声明物体上感兴趣的交互区域,并建立区域与可供性间的映射。然而,学习物体可供性的本质在于理解如何使用它,而这种脱离交互的方式泛化能力有限。通常,人类具备通过演示图像或视频感知物理世界中物体可供性的能力。受此启发,我们引入一种新任务设定:从图像中的 2D 交互定位 3D 物体可供性,其面临通过不同来源交互预测可供性的挑战。为解决这个问题,我们设计了一种新颖的“交互驱动的 3D 可供性定位网络”(IAG),该网络对齐来自不同来源物体的区域特征,并为 3D 物体可供性定位建模交互上下文。此外,我们收集了 Point-Image Affordance Dataset (PIAD) 以支持所提任务。在 PIAD 上的综合实验证明了所提任务的可靠性及我们方法的优越性。项目地址:https://github.com/yyvhang/IAGNet。
引用
@article{arxiv.2303.10437,
title = {Grounding 3D Object Affordance from 2D Interactions in Images},
author = {Yuhang Yang and Wei Zhai and Hongchen Luo and Yang Cao and Jiebo Luo and Zheng-Jun Zha},
journal= {arXiv preprint arXiv:2303.10437},
year = {2023}
}
备注
ICCV2023, camera-ready version