向未知领域:生成新的地理空间描述
计算与语言
2024-07-01 v1 人工智能
摘要
类似关注视觉与语言导航(VLN)任务以弥合视觉与语言之间的鸿沟的具身导航问题,新的Rendezvous (RVS) 任务要求对分配中心空间关系(独立于观察者视点的关系)进行推理,使用非顺序导航指令和地图. 然而,在无训练数据的新环境中性能大幅下降. 使用开源描述搭配坐标(如维基百科)提供训练数据,但受限于空间导向文本导致地理定位分辨率较低. 我们提出一种用于生成新环境高质量合成数据的大规模增强方法. 该方法构建一个 grounded 知识图谱,捕获实体关系. 从采样的实体和关系(`school north of shop')生成导航指令,通过(i)使用上下文无关语法(CFG)生成大量模板以嵌入特定实体和关系; (ii)将实体和关系输入大语言模型(LLM)进行指令生成. 对RVS进行全面评估,表明我们的方法在不可见环境中将100米精度提高了45.83%. 此外,我们展示了使用CFG-based增强训练的模型在不可见和可见环境中均优于使用LLM-based增强训练的模型. 这些发现表明,对于文本基于地理空间推理的潜在优势在先前未知的数据稀缺情形中可以显式地结构化空间信息.
引用
@article{arxiv.2406.19967,
title = {Into the Unknown: Generating Geospatial Descriptions for New Environments},
author = {Tzuf Paz-Argaman and John Palowitch and Sayali Kulkarni and Reut Tsarfaty and Jason Baldridge},
journal= {arXiv preprint arXiv:2406.19967},
year = {2024}
}