中文

通过保持预训练视觉语言模型的多模态能力来提高视觉-语言组合性

计算机视觉与模式识别 2024-10-08 v1 人工智能 计算与语言

摘要

在本文中,我们提出了一种新方法,用于在不牺牲零样本多模态任务性能的前提下增强预训练视觉和语言模型 (VLM) 中的组合理解能力。传统的微调方法通常会在牺牲多模态能力的情况下提高组合推理能力,主要是由于使用全局硬负 (HN) loss,这会对图像和文本的全局表示进行对比。这种全局 HN loss 会推动与原始文本高度相似的 HN 文本,这会损害模型的多模态表示。为克服这一限制,我们提出了 Fine-grained Selective Calibrated CLIP (FSC-CLIP),它集成了局部硬负 loss 和选择性校准正则化。这些创新提供了细粒度的负面监督,同时保持了模型的表示完整性。我们在针对组合性和多模态任务的 diverse 基准测试上进行了广泛评估,结果表明 FSC-CLIP 不仅在组合性方面与最先进的模型持平,还保留了强大的多模态能力。代码已公开:https://github.com/ytaek-oh/fsc-clip。

关键词

引用

@article{arxiv.2410.05210,
  title  = {Preserving Multi-Modal Capabilities of Pre-trained VLMs for Improving Vision-Linguistic Compositionality},
  author = {Youngtaek Oh and Jae Won Cho and Dong-Jin Kim and In So Kweon and Junmo Kim},
  journal= {arXiv preprint arXiv:2410.05210},
  year   = {2024}
}

备注

EMNLP 2024 (Long, Main). Project page: https://ytaek-oh.github.io/fsc-clip