中文

基于元学习的视觉与语言导航中视觉感知泛化

机器人学 2021-01-20 v3 人工智能

摘要

视觉与语言导航(VLN)是一项具有挑战性的任务,要求智能体通过理解自然语言指令和实时接收的视觉信息在真实世界环境中进行导航。先前的工作在连续环境或物理机器人上实现了VLN任务,由于数据集的限制(如1.5米高度、90度水平视场角(HFOV)等),它们均使用固定的相机配置。然而,具有不同用途的真实机器人拥有多种相机配置,视觉信息的巨大差异使得难以在各种机器人之间直接迁移已学习的导航模型。本文提出一种基于元学习的视觉感知泛化策略,使智能体能够通过少量样本快速适应新的相机配置。在训练阶段,我们首先将泛化问题定位到视觉感知模块,然后比较两种元学习算法以在已见和未见环境中实现更好的泛化。其中一种使用需要少量样本适应的模型无关元学习(MAML)算法,另一种参考了带有特征级仿射变换层的基于度量的元学习方法。实验结果表明,我们的策略成功地将已学习的导航模型适应到新的相机配置,且两种算法分别在已见和未见环境中展现出各自的优势。

关键词

引用

@article{arxiv.2012.05446,
  title  = {Visual Perception Generalization for Vision-and-Language Navigation via Meta-Learning},
  author = {Ting Wang and Zongkai Wu and Donglin Wang},
  journal= {arXiv preprint arXiv:2012.05446},
  year   = {2021}
}

备注

8 pages, 4 figures, preprinted version