用于视觉与语言导航的软专家奖励学习
计算机视觉与模式识别
2020-07-22 v1
摘要
视觉与语言导航(VLN)要求智能体通过遵循自然语言指令在未知环境中找到指定地点。基于监督学习的主流方法克隆专家行为,因此在已见环境中表现更好,而在未见环境中表现受限。基于强化学习(RL)的模型展现出更好的泛化能力,但也存在问题,其中之一是需要对大量手动奖励工程。在本文中,我们引入了一种软专家奖励学习(SERL)模型,以克服 VLN 任务的奖励工程设计和泛化问题。我们提出的方法由两个互补组件组成:软专家蒸馏(SED)模块以软方式鼓励智能体尽可能表现得像专家;自感知(SP)模块旨在推动智能体尽可能快地朝向最终目的地。在经验上,我们在 VLN 的已见、未见和测试划分上评估了我们的模型,该模型在大多数评估指标上优于最先进(SOTA)方法。
引用
@article{arxiv.2007.10835,
title = {Soft Expert Reward Learning for Vision-and-Language Navigation},
author = {Hu Wang and Qi Wu and Chunhua Shen},
journal= {arXiv preprint arXiv:2007.10835},
year = {2020}
}