中文

适用于硬性负采样的 MLLM 嵌入的自适应全局与细粒度感知融合

计算机视觉与模式识别 2026-02-06 v1 机器学习

摘要

多模态嵌入作为视觉与语言对齐的桥梁,主要实现方式包括基于 CLIP 和基于 MLLM 的嵌入模型,均局限于仅捕获全局语义信息。尽管众多研究聚焦于细粒度理解,但我们注意到当前 MLLM 嵌入所针对的复杂场景往往包含全局与细粒度元素混合的感知模式,因而需要一种兼容的融合机制。本文提出一种适用于 MLLM 嵌入的自适应全局与细粒度感知融合方法(Adaptive Global and Fine-grained perceptual Fusion for MLLM Embeddings,简称 AGFF-Embed),通过引导 MLLM 生成多个聚焦于不同语义维度的嵌入,再进行自适应平滑聚合。我们将 AGFF-Embed 与显式梯度放大(Explicit Gradient Amplification,简称 EGA)技术结合,实现基于 in-batch 硬负样本的增强,而无需对数据集进行细粒度编辑。在 MMEB 和 MMVP-VLM 基准测试上评估表明,AGFF-Embed 在一般性和细粒度理解方面均实现了与其他多模态嵌入模型相比的状态最佳性能。

关键词

引用

@article{arxiv.2602.05729,
  title  = {Adaptive Global and Fine-Grained Perceptual Fusion for MLLM Embeddings Compatible with Hard Negative Amplification},
  author = {Lexiang Hu and Youze Xue and Dian Li and Gang Liu and Zhouchen Lin},
  journal= {arXiv preprint arXiv:2602.05729},
  year   = {2026}
}