基于语义地图的导航指令生成
计算与语言
2024-03-29 v1 人工智能
计算机视觉与模式识别
摘要
我们对导航指令的生成感兴趣,无论是将其作为独立的输出目标,还是作为机器人导航任务的训练材料。在本文中,我们提出了一种新的导航指令生成方法,将问题构建为使用语义地图作为视觉输入的图像描述任务。传统方法采用全景图像序列来生成导航指令。语义地图抽象掉了视觉细节,并将多张全景图像中的信息融合为单一的自上而下表示,从而降低了处理输入的计算复杂度。我们提出了一个使用语义地图进行指令生成的基准数据集,提出了一个初始模型,并邀请人类受试者手动评估生成指令的质量。我们的初步研究展示了使用语义地图代替全景图像序列进行指令生成的潜力,但仍有巨大的改进空间。我们在 https://github.com/chengzu-li/VLGen 上发布了数据准备和模型训练的代码。
引用
@article{arxiv.2403.19603,
title = {Semantic Map-based Generation of Navigation Instructions},
author = {Chengzu Li and Chao Zhang and Simone Teufel and Rama Sanand Doddipatla and Svetlana Stoyanchev},
journal= {arXiv preprint arXiv:2403.19603},
year = {2024}
}
备注
5 pages, 2 figures, 3 tables (13 pages, 3 figures, 5 tables including references and appendices), accepted at LREC-COLING 2024