视觉-语言导航的预训练在非语义或无关指令下是否有效?
计算与语言
2023-12-27 v4 计算机视觉与模式识别
摘要
在预训练视觉-语言导航(VLN)模型时,通过回译进行数据增强十分常见,尽管生成的指令含有噪声。但是:这种噪声重要吗?我们发现,在 R2R 上,预训练期间的非语义或无关语言指令对 HAMT 和 VLN-BERT 的下游性能影响甚微,且仍优于仅使用干净的人类数据。为强调这些结果,我们设计了一种高效的增强方法 Unigram + Object,它生成的非语义指令仍能提升下游性能。我们的发现表明,对于 VLN R2R 预训练而言,重要的是视觉轨迹的数量,而非指令的质量。
引用
@article{arxiv.2311.17280,
title = {Does VLN Pretraining Work with Nonsensical or Irrelevant Instructions?},
author = {Wang Zhu and Ishika Singh and Yuan Huang and Robin Jia and Jesse Thomason},
journal= {arXiv preprint arXiv:2311.17280},
year = {2023}
}
备注
Accepted by O-DRUM @ CVPR 2023