中文

视觉-语言导航的预训练在非语义或无关指令下是否有效?

计算与语言 2023-12-27 v4 计算机视觉与模式识别

摘要

在预训练视觉-语言导航(VLN)模型时,通过回译进行数据增强十分常见,尽管生成的指令含有噪声。但是:这种噪声重要吗?我们发现,在 R2R 上,预训练期间的非语义或无关语言指令对 HAMT 和 VLN-BERT 的下游性能影响甚微,且仍优于仅使用干净的人类数据。为强调这些结果,我们设计了一种高效的增强方法 Unigram + Object,它生成的非语义指令仍能提升下游性能。我们的发现表明,对于 VLN R2R 预训练而言,重要的是视觉轨迹的数量,而非指令的质量。

关键词

引用

@article{arxiv.2311.17280,
  title  = {Does VLN Pretraining Work with Nonsensical or Irrelevant Instructions?},
  author = {Wang Zhu and Ishika Singh and Yuan Huang and Robin Jia and Jesse Thomason},
  journal= {arXiv preprint arXiv:2311.17280},
  year   = {2023}
}

备注

Accepted by O-DRUM @ CVPR 2023