中文

e5-omni:面向 Omni-modal 嵌入的显式跨模态对齐

计算与语言 2026-01-12 v2 人工智能 计算机视觉与模式识别

摘要

现代信息系统常涉及不同类型的物品,例如文本查询、图像、视频片段或音频段。这驱动了 Omni-modal 嵌入模型将异构模态映射到共享空间进行直接比较。然而,大多数最新的 Omni-modal 嵌入仍严重依赖来自预训练视觉语言模型(VLM)背板的隐式对齐。在实践中,这导致三个常见问题:(i)相似度logit在模态依赖性锋利度上具有差异,导致分数不在一致尺度上;(ii)由于混合模态小批量创建不平衡的硬度分布,批内负样本随时间变得不够有效;因此,许多负样本很快变得平凡且对梯度贡献甚微;(iii)跨模态嵌入显示一阶和二阶统计不匹配,这使排序不够稳定。为解决这些问题,我们提出e5-omni,一种轻量级显式对齐配方,将现成的VLM适应为稳健的Omni-modal嵌入模型。e5-omni结合三个简单组件:(1)模态感知温度校准以对齐相似度尺度;(2)可控制的负样本课程包含去偏处理以聚焦于令人困惑的负样本同时减少虚假负样本的影响;(3)批处理白化与协方差正则化以更好地匹配共享嵌入空间中的跨模态几何。在MMEB-V2和AudioCaps上实验表明,e5-omni consistently优于强大的双模态和Omni-modal基线,相同的配方也良好地转移到其他VLM背板。我们在https://huggingface.co/Haon-Chen/e5-omni-7B发布模型检查点。

关键词

引用

@article{arxiv.2601.03666,
  title  = {e5-omni: Explicit Cross-modal Alignment for Omni-modal Embeddings},
  author = {Haonan Chen and Sicheng Gao and Radu Timofte and Tetsuya Sakai and Zhicheng Dou},
  journal= {arXiv preprint arXiv:2601.03666},
  year   = {2026}
}

备注

https://huggingface.co/Haon-Chen/e5-omni-7B