中文

VLN-PETL:面向视觉-语言导航的参数高效迁移学习

计算机视觉与模式识别 2023-08-22 v1

摘要

近年来,得益于大型预训练视觉-语言模型的使用,视觉-语言导航(VLN)任务的性能取得了快速进展。然而,由于模型规模可观,为每个下游VLN任务全量微调预训练模型正变得成本高昂。参数高效迁移学习(PETL)这一近期研究热点在高效调优大型预训练模型以用于常见CV和NLP任务方面展现出巨大潜力,其充分利用预训练模型中隐含的表征知识,同时仅调优极少量参数。然而,直接将现有PETL方法用于更具挑战性的VLN任务可能导致性能出现明显退化。因此,我们首次开展探索VLN任务中PETL方法的研究,并提出一种名为VLN-PETL的VLN专用PETL方法。具体而言,我们设计了两个PETL模块:历史交互增强器(HIB)与跨模态交互增强器(CIB)。随后我们将这两个模块与若干现有PETL方法结合构成集成的VLN-PETL。在四个主流VLN任务(R2R、REVERIE、NDH、RxR)上的大量实验结果证明了我们所提VLN-PETL的有效性,其取得了与全量微调相当甚至更优的性能,并以可观优势超越其他PETL方法。

关键词

引用

@article{arxiv.2308.10172,
  title  = {VLN-PETL: Parameter-Efficient Transfer Learning for Vision-and-Language Navigation},
  author = {Yanyuan Qiao and Zheng Yu and Qi Wu},
  journal= {arXiv preprint arXiv:2308.10172},
  year   = {2023}
}

备注

Accepted by ICCV 2023