中文

用于视觉与语言导航的软专家奖励学习

计算机视觉与模式识别 2020-07-22 v1

摘要

视觉与语言导航(VLN)要求智能体通过遵循自然语言指令在未知环境中找到指定地点。基于监督学习的主流方法克隆专家行为,因此在已见环境中表现更好,而在未见环境中表现受限。基于强化学习(RL)的模型展现出更好的泛化能力,但也存在问题,其中之一是需要对大量手动奖励工程。在本文中,我们引入了一种软专家奖励学习(SERL)模型,以克服 VLN 任务的奖励工程设计和泛化问题。我们提出的方法由两个互补组件组成:软专家蒸馏(SED)模块以软方式鼓励智能体尽可能表现得像专家;自感知(SP)模块旨在推动智能体尽可能快地朝向最终目的地。在经验上,我们在 VLN 的已见、未见和测试划分上评估了我们的模型,该模型在大多数评估指标上优于最先进(SOTA)方法。

关键词

引用

@article{arxiv.2007.10835,
  title  = {Soft Expert Reward Learning for Vision-and-Language Navigation},
  author = {Hu Wang and Qi Wu and Chunhua Shen},
  journal= {arXiv preprint arXiv:2007.10835},
  year   = {2020}
}