中文

MegaPairs:用于通用多模态检索的大规模数据合成

计算机视觉与模式识别 2024-12-20 v1 计算与语言

摘要

尽管多模态检索需求迅速增长,但该领域的进展严重受限于训练数据的缺乏。本文引入 MegaPairs,一种新颖的数据合成方法,利用视觉语言模型(VLM)和开放域图像,生成大规模合成数据集。我们的实证分析表明,MegaPairs 生成的高质量数据,使多模态检索器显著超越在现有数据集上训练的基线模型(数据量为 70 倍)。此外,由于 MegaPairs 仅依赖通用图像语料库和开源 VLM,可轻松扩展,从而实现检索性能的持续提升。本阶段,我们生成了超过 2600 万训练实例,并训练了多个规模不同的模型。这些新模型在 4 个流行的组合图像检索(CIR)基准测试中实现了最佳零样本性能,在 MMEB 提供的 36 个数据集上实现最高整体性能。它们还在额外的下游微调中表现出显著的性能提升。我们生产的 dataset、经过训练的模型和数据合成管道将公开释放,以促进该领域的未来发展。

关键词

引用

@article{arxiv.2412.14475,
  title  = {MegaPairs: Massive Data Synthesis For Universal Multimodal Retrieval},
  author = {Junjie Zhou and Zheng Liu and Ze Liu and Shitao Xiao and Yueze Wang and Bo Zhao and Chen Jason Zhang and Defu Lian and Yongping Xiong},
  journal= {arXiv preprint arXiv:2412.14475},
  year   = {2024}
}