中文

并非一个通吃所有!论视觉编码器在视觉与语言任务中的互补性

计算机视觉与模式识别 2023-06-09 v2 计算与语言

摘要

当前旨在解决视觉与语言(V+L)任务的多模态模型,主要将视觉编码器(VE)重新用作特征提取器。尽管许多不同架构、在不同数据与目标上训练的VE已公开可用,它们并非为下游V+L任务设计。然而,多数当前工作假设单个预训练VE可作为通用编码器。本工作中,我们聚焦分析,旨在理解不同VE内存储的信息是否互补,即向模型提供多个VE的特征是否能提升目标任务性能,以及它们如何组合。我们在六个下游V+L任务上用三种流行VE进行了详尽实验,并分析注意力与VE丢弃模式。我们的分析表明多样VE相互补充,带来下游V+L任务性能提升,且提升并非源于简单集成效应(即性能并不总随编码器数量增加而提升)。我们证明,未来并非重新用途、而是为V+L任务显式设计的VE,有潜力提升目标V+L任务上的性能。

关键词

引用

@article{arxiv.2210.06379,
  title  = {One does not fit all! On the Complementarity of Vision Encoders for Vision and Language Tasks},
  author = {Gregor Geigle and Chen Cecilia Liu and Jonas Pfeiffer and Iryna Gurevych},
  journal= {arXiv preprint arXiv:2210.06379},
  year   = {2023}
}

备注

Repl4NLP 2023