从以太元交互中对3D场景可达性进行 grounding
计算机视觉与模式识别
2024-10-01 v1 人工智能
摘要
将3D场景可达性从以太元交互中进行 grounding 旨在定位3D环境中的可交互区域,这对于智能体与周围环境进行交互至关重要。目前大多数方法通过将语义映射到基于静态几何结构和视觉外观的3D实例来实现这一点。这种被动策略限制了智能体主动感知并与环境交互的能力,使其依赖于预定义的语义指令。相反,人类通过观察和模仿他人如何与周围环境交互来发展出复杂的交互技能。为了赋予模型此类能力,我们引入了一种新任务:基于以太元交互的3D场景可达性 grounding,即根据与交互相关的以太元视频,识别3D场景中相应可达性区域的对应关系。这一任务面临空间复杂性和跨多个来源的对齐复杂性挑战。为解决这些挑战,我们提出了以太元交互驱动的3D场景可达性 grounding (Ego-SAG) 框架,该框架利用交互意图引导模型聚焦于交互相关子区域,并通过双向查询解码器机制对来自不同来源的可达性特征进行对齐。此外,我们引入了以太元视频-3D场景可达性数据集 (VSAD),涵盖广泛的常见交互类型和多样化的3D环境,以支持这一任务。对VSAD上的大量实验验证了所提出任务的可行性以及我们方法的有效性。
引用
@article{arxiv.2409.19650,
title = {Grounding 3D Scene Affordance From Egocentric Interactions},
author = {Cuiyu Liu and Wei Zhai and Yuhang Yang and Hongchen Luo and Sen Liang and Yang Cao and Zheng-Jun Zha},
journal= {arXiv preprint arXiv:2409.19650},
year = {2024}
}