中文

TINA:面向零样本视觉语言导航的思考、交互与行动框架

计算机视觉与模式识别 2024-03-15 v1 人工智能

摘要

零样本导航是视觉语言导航(VLN)任务中的一项关键挑战,适应陌生指令并在未知环境中行动的能力至关重要。现有的基于监督学习的模型通过强化学习利用标注数据进行训练,在泛化能力上表现出局限性。大型语言模型(LLM)凭借其丰富的知识与涌现的推理能力,为实现零样本导航提供了一条潜在途径。本文提出了一种基于 LLM 的 VLN 智能体,探索解决零样本导航问题的方法。为弥补 LLM 在环境感知方面的不足,我们提出了思考、交互与行动(TINA)框架。TINA 使智能体能够审查感知信息,并通过引入的问答模块自主查询环境内的关键线索,从而将指令与特定感知数据对齐。通过 TINA 框架,导航智能体的感知能力得到增强,同时显式的思考与查询过程也提升了导航过程的可解释性与透明度。我们在 Room-to-Room 数据集上评估了该方法的性能。实验结果表明,我们的方法提升了基于 LLM 的智能体的导航性能。该方法也优于部分基于监督学习的方法,凸显了其在零样本导航中的有效性。

关键词

引用

@article{arxiv.2403.08833,
  title  = {TINA: Think, Interaction, and Action Framework for Zero-Shot Vision Language Navigation},
  author = {Dingbang Li and Wenzhou Chen and Xin Lin},
  journal= {arXiv preprint arXiv:2403.08833},
  year   = {2024}
}