中文

利用MLLM先验通过偏好对齐引导跨模态表示

计算机视觉与模式识别 2026-01-01 v3

摘要

尽管对比学习-图像-文本预训练(CLIP)在跨模态检索方面表现突出,但其特征空间中仍存在显著的模态差距。有趣的是,我们发现即插即用的MLLM(多模态大语言模型)具有强大的内在模态对齐特性。虽然最近基于MLLM的检索器采用统一架构部分缓解了这一差距,但其依赖粗糙模态对齐机制却根本限制了潜力。本文引入了MAPLE(Modality-Aligned Preference Learning for Embeddings),一个新框架,利用MLLM中固有的细粒度对齐先验指导跨模态表示学习。MAPLE将学习过程形式化为强化学习,包含两个关键组件:(1)利用即插即用的MLLM构建自动偏好数据,(2)一种新的相对偏好对齐(RPA)损失,将直接偏好优化(DPO)适用于嵌入学习设置。实验结果表明,我们的偏好引导对齐在细粒度跨模态检索中实现了显著提升,凸显了其处理细微语义差异的有效性。

关键词

引用

@article{arxiv.2506.06970,
  title  = {Guiding Cross-Modal Representations with MLLM Priors via Preference Alignment},
  author = {Pengfei Zhao and Rongbo Luan and Wei Zhang and Peng Wu and Sifeng He},
  journal= {arXiv preprint arXiv:2506.06970},
  year   = {2026}
}

备注

Accepted by NeurIPS 2025