中文

视觉语言导航中用于指令跟随与生成的因果循环一致学习

计算机视觉与模式识别 2022-04-01 v1

摘要

自视觉语言导航(VLN)兴起以来,在指令跟随——即在指令引导下构建导航智能体以遍历环境——方面已取得巨大进展。然而,其逆任务:指令生成——学习一个说话者(speaker)为导航路径生成接地描述——却鲜受关注。现有VLN方法独立训练说话者,常将其视为数据增强工具以强化跟随者(follower),而忽略了丰富的跨任务关联。本文提出一种同时学习这两个任务并利用其内在相关性相互促进训练的方法:跟随者判断说话者生成的指令是否正确解释了原始导航路径,反之亦然。无需对齐的指令-路径对,这种循环一致学习方案与有标签数据上定义的任务特定训练目标互补,也可应用于无标签路径(采样而无配对指令)。我们引入另一个称为创建者(creator)的智能体来生成反事实环境。它大幅改变当前场景,却保留对执行原始指令至关重要的新物体不变。由此合成更具信息量的训练场景,三个智能体构成一个强大的VLN学习系统。在标准基准上的大量实验表明,我们的方法提升了多种跟随者模型的性能,并生成准确的导航指令。

关键词

引用

@article{arxiv.2203.16586,
  title  = {Counterfactual Cycle-Consistent Learning for Instruction Following and Generation in Vision-Language Navigation},
  author = {Hanqing Wang and Wei Liang and Jianbing Shen and Luc Van Gool and Wenguan Wang},
  journal= {arXiv preprint arXiv:2203.16586},
  year   = {2022}
}

备注

Accepted to CVPR 2022