NavHint:带有提示生成器的视觉与语言导航智能体
计算与语言
2024-02-06 v1
摘要
现有的视觉与语言导航工作主要依赖导航相关的损失来建立视觉和语言模态之间的联系,忽视了帮助导航智能体建立对视觉环境深层理解的方面。在我们的工作中,我们通过一个提供详细视觉描述的提示生成器,为导航智能体提供间接监督。该提示生成器协助导航智能体发展对视觉环境的全局理解,并将智能体的注意力引导至相关的导航细节,包括相关的子指令、识别中的潜在挑战、接地中的歧义以及目标视点描述。为了训练提示生成器,我们基于指令中的地标以及视觉环境中可见且独特的物体构建了一个合成数据集。我们在 R2R 和 R4R 数据集上评估了我们的方法,并在多项指标上达到了最先进水平 (SOTA)。实验结果表明,生成提示不仅提升了导航性能,还有助于提高智能体动作的可解释性。
引用
@article{arxiv.2402.02559,
title = {NavHint: Vision and Language Navigation Agent with a Hint Generator},
author = {Yue Zhang and Quan Guo and Parisa Kordjamshidi},
journal= {arXiv preprint arXiv:2402.02559},
year = {2024}
}