并非一个通吃所有!论视觉编码器在视觉与语言任务中的互补性
计算机视觉与模式识别
2023-06-09 v2 计算与语言
摘要
当前旨在解决视觉与语言(V+L)任务的多模态模型,主要将视觉编码器(VE)重新用作特征提取器。尽管许多不同架构、在不同数据与目标上训练的VE已公开可用,它们并非为下游V+L任务设计。然而,多数当前工作假设单个预训练VE可作为通用编码器。本工作中,我们聚焦分析,旨在理解不同VE内存储的信息是否互补,即向模型提供多个VE的特征是否能提升目标任务性能,以及它们如何组合。我们在六个下游V+L任务上用三种流行VE进行了详尽实验,并分析注意力与VE丢弃模式。我们的分析表明多样VE相互补充,带来下游V+L任务性能提升,且提升并非源于简单集成效应(即性能并不总随编码器数量增加而提升)。我们证明,未来并非重新用途、而是为V+L任务显式设计的VE,有潜力提升目标V+L任务上的性能。
引用
@article{arxiv.2210.06379,
title = {One does not fit all! On the Complementarity of Vision Encoders for Vision and Language Tasks},
author = {Gregor Geigle and Chen Cecilia Liu and Jonas Pfeiffer and Iryna Gurevych},
journal= {arXiv preprint arXiv:2210.06379},
year = {2023}
}
备注
Repl4NLP 2023