中文

视觉扰动与自适应硬负例对比学习:面向视觉语言模型的组合推理

计算机视觉与模式识别 2025-08-29 v2 机器学习

摘要

视觉语言模型 (VLMs) 是多模态任务中至关重要的技术,尤其是组合推理 (CR) 任务,需要区分视觉与文本嵌入之间细粒度的语义差异。然而,现有方法主要通过生成文本-based硬负例样本来进行微调,忽视了图像-based负例样本的重要性,导致视觉编码器训练不足,最终影响模型整体性能。此外,负样本通常被统一处理,而不考虑其难度等级,正样本的对齐也不充分,导致难样本对的对齐存在挑战。为此,本文提出自适应硬负例扰动学习 (AHNPL) 方法。AHNPL将文本-based硬负例转化到视觉领域,生成语义被扰动的图像-based负例用于模型训练,从而提升整体性能。AHNPL还引入基于多模态硬负例损失的对比学习方法,提高模型对每个模态内部硬负例的辨别能力,并设计动态间隔损失,根据样本难度调整对比间隔,以增强难样本对的区分度。在三个公开数据集上的实验表明,我们的方法有效提升了VLMs在复杂CR任务上的性能。源代码已公开于 https://github.com/nynu-BDAI/AHNPL。

关键词

引用

@article{arxiv.2505.15576,
  title  = {Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models},
  author = {Xin Huang and Ruibin Li and Tong Jia and Wei Zheng and Ya Wang},
  journal= {arXiv preprint arXiv:2505.15576},
  year   = {2025}
}

备注

Accepted at the International Joint Conference on Artificial Intelligence (IJCAI 2025)