中文

利用合成数据超越名词:视觉与语言模型的新进展

计算机视觉与模式识别 2023-08-31 v2 计算与语言

摘要

大规模预训练视觉与语言(VL)模型已在诸多应用中展现卓越性能,使得以零样本开放词汇推理替代固定支持类别集成为可能(基于几乎任意的自然语言提示)。然而,近期研究揭示了这些模型的一个根本弱点。例如,它们难以理解超越名词的视觉语言概念(VLC),如非物体词(属性、动作、关系、状态等)的含义,或难以进行组合推理(如理解句中词序的重要性)。本工作中,我们探究在多大程度上可利用纯合成数据教会这些模型克服此类缺陷,且不损害其零样本能力。我们贡献了 Synthetic Visual Concepts(SyViC)——一个百万级合成数据集与数据生成代码库,可生成额外适用数据以改进 VL 模型的 VLC 理解与组合推理。此外,我们提出一种通用 VL 微调策略,以有效利用 SyViC 实现这些改进。我们在 VL-Checklist、Winoground 与 ARO 基准上的大量实验与消融表明,用合成数据适配强预训练 VL 模型可显著增强其 VLC 理解(如 ARO 上提升 9.9%、VL-Checklist 上提升 4.3%),而其零样本精度下降不足 1%。

关键词

引用

@article{arxiv.2303.17590,
  title  = {Going Beyond Nouns With Vision & Language Models Using Synthetic Data},
  author = {Paola Cascante-Bonilla and Khaled Shehada and James Seale Smith and Sivan Doveh and Donghyun Kim and Rameswar Panda and Gül Varol and Aude Oliva and Vicente Ordonez and Rogerio Feris and Leonid Karlinsky},
  journal= {arXiv preprint arXiv:2303.17590},
  year   = {2023}
}

备注

Accepted to ICCV 2023. Project page: https://synthetic-vic.github.io/