中文

SciMMIR:科学多模态信息检索基准测试

信息检索 2024-06-12 v2 计算与语言 计算机视觉与模式识别 多媒体

摘要

多模态信息检索 (MMIR) 是一个快速发展的领域,通过先进的表示学习和跨模态对齐研究,在图文配对方面取得了显著进展。然而,当前用于评估科学领域内图文配对 MMIR 性能的基准测试存在明显空白,学术语言描述的图表和表格图像通常未发挥重要作用。为了弥合这一空白,我们利用开放获取的论文集合提取与科学领域相关的数据,开发了一个专门的科学 MMIR (SciMMIR) 基准。该基准包含 53 万对精心策划的图文对,提取自科学文档中带有详细标题的图表。我们进一步用两层子集-子类别层级标注来标注这些图文对,以促进对基线模型更全面的评估。我们在突出的多模态图像描述模型和视觉语言模型(如 CLIP 和 BLIP)上进行了零样本和微调评估。我们的分析为科学领域的 MMIR 提供了关键见解,包括预训练和微调设置的影响以及视觉与文本编码器的影响。我们所有的数据和检查点均公开于 https://github.com/Wusiwei0410/SciMMIR。

关键词

引用

@article{arxiv.2401.13478,
  title  = {SciMMIR: Benchmarking Scientific Multi-modal Information Retrieval},
  author = {Siwei Wu and Yizhi Li and Kang Zhu and Ge Zhang and Yiming Liang and Kaijing Ma and Chenghao Xiao and Haoran Zhang and Bohao Yang and Wenhu Chen and Wenhao Huang and Noura Al Moubayed and Jie Fu and Chenghua Lin},
  journal= {arXiv preprint arXiv:2401.13478},
  year   = {2024}
}

备注

camera-ready version for ACL 2024 Findings