中文

StratXplore:面向视觉与语言导航的策略性寻新与指令对齐探索

机器人学 2024-09-10 v1

摘要

具身导航要求机器人根据给定任务理解并与环境交互。视觉与语言导航(VLN)是一种具身导航任务,机器人根据语言指令和视觉输入在已见与未见环境中进行导航。VLN智能体需要同时访问局部和全局动作空间;前者用于即时决策,后者用于从导航错误中恢复。先前的VLN智能体仅依赖指令-视点对齐进行局部和全局决策,并在指令与当前视点不匹配时回溯至先前访问过的视点。由于指令的复杂性和环境的部分可观测性,这些方法容易出错。我们认为回溯是次优的,意识到自身错误的智能体能够高效恢复。为实现最优恢复,应将探索扩展至未探索的视点(或边界)。最优边界是近期观察到但尚未探索、与指令对齐且具有新颖性的视点。我们为VLN智能体引入了一种基于记忆且感知错误的路径规划策略,称为\textit{StratXplore},该策略通过全局和局部动作规划选择最优边界以进行路径纠正。所提方法在导航过程中收集所有历史动作和视点特征,随后选择适合恢复的最优边界。实验结果表明,这种简单而有效的策略在两个具有不同任务复杂度的VLN数据集上提高了成功率。

关键词

引用

@article{arxiv.2409.05593,
  title  = {StratXplore: Strategic Novelty-seeking and Instruction-aligned Exploration for Vision and Language Navigation},
  author = {Muraleekrishna Gopinathan and Jumana Abu-Khalaf and David Suter and Martin Masek},
  journal= {arXiv preprint arXiv:2409.05593},
  year   = {2024}
}