中文

用于视觉与语言导航中改进视觉表示的结构编码辅助任务

计算机视觉与模式识别 2022-11-22 v1 人工智能

摘要

在视觉与语言导航(Vision-and-Language Navigation, VLN)中,研究者通常采用在 ImageNet 上预训练的图像编码器,而不在智能体将训练或测试的环境上微调。然而,ImageNet 的训练图像与导航环境中的视图之间的分布偏移可能使 ImageNet 预训练的图像编码器并非最优。因此,本文设计了一组结构编码辅助任务(structure-encoding auxiliary tasks, SEA),利用导航环境中的数据来预训练并改进图像编码器。具体而言,我们设计并定制了(1) 3D 拼图、(2) 可通行性预测和(3) 实例分类来预训练图像编码器。通过严谨的消融实验,我们的 SEA 预训练特征被证明能更好地编码场景的结构信息,而 ImageNet 预训练特征无法恰当编码该信息,但其对目标导航任务至关重要。SEA 预训练特征无需任何调优即可轻松插入现有 VLN 智能体。例如,在 Test-Unseen 环境中,结合我们 SEA 预训练特征的 VLN 智能体在 Speaker-Follower 上取得 12% 的绝对成功率提升,在 Env-Dropout 上取得 5%,在 AuxRN 上取得 4%。

关键词

引用

@article{arxiv.2211.11116,
  title  = {Structure-Encoding Auxiliary Tasks for Improved Visual Representation in Vision-and-Language Navigation},
  author = {Chia-Wen Kuo and Chih-Yao Ma and Judy Hoffman and Zsolt Kira},
  journal= {arXiv preprint arXiv:2211.11116},
  year   = {2022}
}