从生成器到嵌入器:通过构建零样本判别式嵌入模型发掘多模态 LLM 的内在能力
机器学习
2026-03-02 v2 人工智能
信息检索
摘要
将生成式多模态大型语言模型 (MLLM) 适配为通用嵌入模型通常需要资源密集型的对比预训练,而传统的硬性负采样方法则受到严重的假负样本污染。本文提出了一个高度数据高效的框架,绕过大规模预训练以构建稳健的多模态表征空间。我们首先引入分层嵌入提示,提供强大的潜在条件。通过在系统层面明确锚定任务定义,该提示策略有效地弥合了模态间的差距,并释放了强大的零样本嵌入能力。基于此潜在条件,我们提出了自我感知硬负采样 (SaHa)。不同于常规的候选空间采样,SaHa 将机制转向查询空间,通过将检索到的候选者映射回其所属查询,以严格筛除语义上的假负样本。此外,我们的方法构建互为硬性的簇,最大化任务内的判别性和批处理效率,无需额外的前向传播。广泛的实验表明,我们的统一方法仅使用标准训练数据的有限比例,就在 Massive Multimodal Embedding Benchmark 上实现了与竞争性的微调性能。
引用
@article{arxiv.2508.00955,
title = {From Generator to Embedder: Harnessing Innate Abilities of Multimodal LLMs via Building Zero-Shot Discriminative Embedding Model},
author = {Yeong-Joon Ju and Seong-Whan Lee},
journal= {arXiv preprint arXiv:2508.00955},
year = {2026}
}