“我在哪里?”基于语言的场景检索
计算机视觉与模式识别
2024-11-11 v2
摘要
自然语言界面正在 becoming more ubiquitous于具身AI。我们日常生活中的语言交互为具身智能体提供了进一步的机会,例如用户口头指示智能体在特定位置执行某项任务。例如,“把碗子放回冰箱旁的橱柜”或“在红色指示牌下的交叉口见我”。因此,我们需要在自然语言和环境地图表示之间建立接口方法。为此,我们探讨了是否可以使用开放集自然语言查询来识别由3D场景图表示的场景。我们将此任务定义为“language-based scene-retrieval”,它 closely related to“coarse-localization”,但我们不是在大规模连续地图中搜索,而是在一组互不相连的场景中进行搜索。我们提出了Text2SceneGraphMatcher,一个学习文本描述与场景图之间联合嵌入以确定是否匹配的“场景检索”管道。代码、训练好的模型和数据集将公开提供。
引用
@article{arxiv.2404.14565,
title = {"Where am I?" Scene Retrieval with Language},
author = {Jiaqi Chen and Daniel Barath and Iro Armeni and Marc Pollefeys and Hermann Blum},
journal= {arXiv preprint arXiv:2404.14565},
year = {2024}
}