通过显式困难负样本梯度放大改进多模态嵌入学习
计算机视觉与模式识别
2025-06-04 v1 机器学习
摘要
近年来,随着多模态大语言模型(MLLMs)的快速发展,基础的对比语言-图像预训练(CLIP)框架已成功扩展至 MLLMs,为广泛的检索任务提供了更强大、更通用的多模态嵌入。尽管取得了这些进展,但从 CLIP 风格模型到 MLLMs,核心的对比学习范式在很大程度上保持不变。在该框架内,有效挖掘困难负样本仍然是提升性能的关键因素。先前的工作引入了离线和在线的困难负样本挖掘策略,以提高对比学习的效率。虽然这些方法改进了多模态嵌入,但每个困难负样本对学习过程的具体贡献尚未得到深入研究。在本工作中,我们详细分析了 info-NCE 损失相对于查询、正样本和负样本的梯度,阐明了困难负样本在更新模型参数中的作用。基于此分析,我们提出显式放大与困难负样本相关的梯度,从而鼓励模型学习更具判别性的嵌入。我们采用所提出的显式梯度放大器训练的、基于 LLaVA-OneVision-7B 架构的多模态嵌入模型,与以往使用相同 MLLM 主干的方法相比,在 MMEB 基准上取得了 SOTA 的性能。此外,当与我们自研的 MLLM QQMM 集成时,我们的方法在 MMEB 排行榜上名列第一。代码和模型已发布于 https://github.com/QQ-MM/QQMM-embed。
引用
@article{arxiv.2506.02020,
title = {Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying},
author = {Youze Xue and Dian Li and Gang Liu},
journal= {arXiv preprint arXiv:2506.02020},
year = {2025}
}