我们该往何处去?从自然空间描述中进行多尺度异中心关系推理
计算与语言
2024-08-06 v2 机器学习
多媒体
摘要
在用自然语言传达路线时,所获得的空间知识概念对于地理信息检索(GIR)和空间认知研究至关重要。然而,NLP导航研究常常忽视这种获得的知识对文本描述的影响。当前的导航研究集中于以自我为中心的局部描述(例如,“它将在你的右边”),这需要对智能体的局部感知进行推理。这些指令通常以一系列步骤的形式给出,每个动作步骤明确提及并跟随一个地标,智能体可以用它来验证自己是否走在正确的道路上(例如,“右转,然后你会看到……”)。相比之下,基于通过地图获得的知识的描述提供了环境的完整视图并捕捉了其整体结构。这些指令(例如,“它在中央公园以南,警察局以北一个街区”)通常是非顺序的,包含异中心关系,具有多个空间关系和隐含动作,没有任何明确的验证。本文介绍了Rendezvous(RVS)任务和数据集,其中包括10,404个使用地图知识到达目标位置的英文地理空间指令示例。我们的分析表明,与之前的基于文本的导航基准相比,RVS表现出更丰富的空间异中心关系使用,并且需要同时解析更多的空间关系。
引用
@article{arxiv.2402.16364,
title = {Where Do We Go from Here? Multi-scale Allocentric Relational Inference from Natural Spatial Descriptions},
author = {Tzuf Paz-Argaman and Sayali Kulkarni and John Palowitch and Jason Baldridge and Reut Tsarfaty},
journal= {arXiv preprint arXiv:2402.16364},
year = {2024}
}