中文

C3L:基于对比学习的内容相关视觉-语言指令微调数据生成

计算机视觉与模式识别 2024-07-03 v2

摘要

视觉-语言指令微调(VLIT)是大型视觉-语言模型(LVLMs)的关键训练阶段。随着开源 LVLMs 能力的提升,研究人员越来越多地转向使用开源 LVLMs 生成 VLIT 数据,并取得了显著进展。然而,此类数据生成方法受限于以下挑战:1)由于多模态模型容易受先验语言知识影响,直接使用 LVLMs 生成 VLIT 数据不可避免地会导致生成数据与图像之间的内容相关性较低。2)为了提升模型生成 VLIT 数据的能力,以往方法引入了额外的训练阶段以增强生成能力。这一过程损害了模型对未见输入的泛化能力(即“曝光偏差”问题)。在本文中,我们提出了一种基于对比学习的内容相关 VLIT 数据生成方法(C3L)。具体而言,我们设计了一个新的内容相关性模块,通过计算图像-指令对应分数 S(I2C) 来增强 VLIT 数据与图像之间的内容相关性。此外,引入了对比学习模块以进一步提升 LVLMs 的 VLIT 数据生成能力。在四个基准测试上的大量自动评估指标表明了我们方法的有效性。

关键词

引用

@article{arxiv.2405.12752,
  title  = {C3L: Content Correlated Vision-Language Instruction Tuning Data Generation via Contrastive Learning},
  author = {Ji Ma and Wei Suo and Peng Wang and Yanning Zhang},
  journal= {arXiv preprint arXiv:2405.12752},
  year   = {2024}
}

备注

Accepted by IJCAI-24