利用MLLM先验通过偏好对齐引导跨模态表示
计算机视觉与模式识别
2026-01-01 v3
摘要
尽管对比学习-图像-文本预训练(CLIP)在跨模态检索方面表现突出,但其特征空间中仍存在显著的模态差距。有趣的是,我们发现即插即用的MLLM(多模态大语言模型)具有强大的内在模态对齐特性。虽然最近基于MLLM的检索器采用统一架构部分缓解了这一差距,但其依赖粗糙模态对齐机制却根本限制了潜力。本文引入了MAPLE(Modality-Aligned Preference Learning for Embeddings),一个新框架,利用MLLM中固有的细粒度对齐先验指导跨模态表示学习。MAPLE将学习过程形式化为强化学习,包含两个关键组件:(1)利用即插即用的MLLM构建自动偏好数据,(2)一种新的相对偏好对齐(RPA)损失,将直接偏好优化(DPO)适用于嵌入学习设置。实验结果表明,我们的偏好引导对齐在细粒度跨模态检索中实现了显著提升,凸显了其处理细微语义差异的有效性。
引用
@article{arxiv.2506.06970,
title = {Guiding Cross-Modal Representations with MLLM Priors via Preference Alignment},
author = {Pengfei Zhao and Rongbo Luan and Wei Zhang and Peng Wu and Sifeng He},
journal= {arXiv preprint arXiv:2506.06970},
year = {2026}
}
备注
Accepted by NeurIPS 2025