中文

以更少双模态监督训练视觉-语言模型

计算与语言 2022-11-02 v1 计算机视觉与模式识别

摘要

预训练多模态模型(如视觉-语言模型)的标准做法是依赖来自两个模态的对齐输入对,例如对齐的图像-文本对。然而,在低资源环境以及对于某些模态对(如结构化表格与图像),此类配对难以获取。在这项工作中,我们研究了能在多大程度上减少对这类并行数据的依赖(我们称之为双模态监督),并使用在各模态上独立预训练的模型。我们以一个高性能的视觉-语言模型进行实验,并分析了双模态监督在三个视觉-语言任务上的影响。我们发现,在较简单的任务(如 VQAv2 和 GQA)上,可以完全消除双模态监督,仅遭受微小的性能损失。相反,对于需要更复杂推理的 NLVR2,无双模态监督的训练会导致随机水平的表现。尽管如此,仅使用 5% 的双模态数据(142K 图像及其标题),或利用每幅图像机器生成标签列表形式的弱监督,相比使用 3M 图像-文本对仅导致中等程度退化:74%\rightarrow\sim70%。我们的代码可在 https://github.com/eladsegal/less-bimodal-sup 获取。

关键词

引用

@article{arxiv.2211.00262,
  title  = {Training Vision-Language Models with Less Bimodal Supervision},
  author = {Elad Segal and Ben Bogin and Jonathan Berant},
  journal= {arXiv preprint arXiv:2211.00262},
  year   = {2022}
}

备注

AKBC 2022