mmE5:通过高质量合成数据改进多模态多语言嵌入
计算机视觉与模式识别
2025-02-13 v1 人工智能
计算与语言
摘要
多模态嵌入模型因其将文本和图像等不同模态数据映射到统一表示空间的能力而备受关注。然而,有限的标注多模态数据常常阻碍嵌入性能。近期方法利用数据合成来解决这一问题,但合成数据的质量仍然是一个关键瓶颈。在本工作中,我们确定了高质量合成多模态数据的三个标准。首先,广泛的范围确保生成的数据覆盖多样化的任务和模态,使其适用于各种下游场景。其次,鲁棒的跨模态对齐使得不同模态在语义上保持一致。第三,高保真度确保合成数据保持逼真的细节以增强其可靠性。在这些原则的指导下,我们合成的数据集:(1)覆盖广泛的任务、模态组合和语言;(2)通过多模态大语言模型的单次深度思考过程生成;(3)结合真实世界图像与准确相关的文本,通过自我评估和优化确保保真度。利用这些高质量的合成和标注数据集,我们训练了一个多模态多语言E5模型mmE5。大量实验表明,mmE5在MMEB基准测试上达到了最先进的性能,并在XTD基准测试上展现了卓越的多语言性能。我们的代码、数据集和模型已在https://github.com/haon-chen/mmE5发布。
引用
@article{arxiv.2502.08468,
title = {mmE5: Improving Multimodal Multilingual Embeddings via High-quality Synthetic Data},
author = {Haonan Chen and Liang Wang and Nan Yang and Yutao Zhu and Ziliang Zhao and Furu Wei and Zhicheng Dou},
journal= {arXiv preprint arXiv:2502.08468},
year = {2025}
}