用于视觉与语言导航指令生成的空间感知说话者模型
计算与语言
2024-09-10 v1
摘要
具身智能旨在开发能够理解和执行人类语言指令,并能用自然语言进行交流的机器人。在此前沿上,我们研究生成为具身机器人遵循的高度详细导航指令的任务。尽管最近的研究在从图像序列生成逐步指令方面取得了显著飞跃,但生成的指令在指代物体和地标方面缺乏多样性。现有的说话者模型学会了规避评估指标的策略,即使对于低质量句子也能获得更高分数。在本工作中,我们提出了 SAS (Spatially-Aware Speaker),一种指令生成器或说话者模型,它利用环境的结构和语义知识来生成更丰富的指令。在训练中,我们在对抗环境中采用奖励学习方法,以避免语言评估指标引入的系统性偏差。根据经验,我们的方法在使用标准指标评估时优于现有的指令生成模型。我们的代码可在 \url{https://github.com/gmuraleekrishna/SAS} 获取。
引用
@article{arxiv.2409.05583,
title = {Spatially-Aware Speaker for Vision-and-Language Navigation Instruction Generation},
author = {Muraleekrishna Gopinathan and Martin Masek and Jumana Abu-Khalaf and David Suter},
journal= {arXiv preprint arXiv:2409.05583},
year = {2024}
}