中文

OmniScience:面向科学图像理解的大规模多模态数据集

计算机视觉与模式识别 2026-02-17 v1 人工智能

摘要

多模态大语言模型在自然图像理解方面表现出色,但在解释科学图像(包括但不限于示意图、实验表征图和分析图表)时能力有限。这一限制在开源 MLLM 中尤为突出。数据集的领域覆盖范围有限、结构标注粗糙且语义对齐不足,导致了这一差距。我们引入 OmniScience,一个规模庞大且高保真的多模态数据集,包含 150 万组图文-情境三元组,覆盖超过 10 个主要科学学科。为获得更高信息密度和准确性的图像描述数据,我们开发了动态模型路由重描述管道,利用最先进的多模态大语言模型联合合成视觉特征、原始图表说明以及由人类科学家撰写的对应文本参考,生成密集且自包含的描述。该管道还经过严格的质量筛选和与人类专家判断的对齐,确保事实准确性和语义完整性,将图像-文本多模态相似度提升至 0.956。我们进一步提出了图文 QA 协议,作为评估视觉理解的代理任务。基于 OmniScience 微调的 Qwen2.5-VL-3B 模型在 MM-MT-Bench 上获得 0.378 的提升,在 MMMU 上获得 0.140 的提升。

关键词

引用

@article{arxiv.2602.13758,
  title  = {OmniScience: A Large-scale Multi-modal Dataset for Scientific Image Understanding},
  author = {Haoyi Tao and Chaozheng Huang and Nan Wang and Han Lyu and Linfeng Zhang and Guolin Ke and Xi Fang},
  journal= {arXiv preprint arXiv:2602.13758},
  year   = {2026}
}