中文

S1-MMAlign:用于科学图-文理解的大规模、跨学科数据集

计算机视觉与模式识别 2026-05-07 v2

摘要

多模态学习已在通用领域任务中取得巨大进展,但其在科学发现中的应用受到科学图像与稀疏文本描述之间显著语义鸿沟的制约。我们提出S1-MMAlign,一个大规模、跨学科的多模态数据集,包含来自250万篇开放获取科学论文的1550万个高质量图像-文本对。该数据集涵盖从物理、生物学到工程学等多个学科,捕捉了包括实验 setup、热图和显微图像等多样化的视觉模态。为解决原始科学标题中弱对齐问题,我们引入了AI就绪的语义增强管道,利用先进的多模态大语言模型重新描述图像,通过综合论文摘要和相应图表的引用语境来构建上下文。技术验证表明,我们的增强管道通过降低SciBERT伪困惑度和增强CLIP图像-文本对齐,显著提升了数据质量,同时也显著提升了多模态大语言模型在零样本科学标题生成、跨域科学推理和视觉指令调优中的性能。S1-MMAlign为AI for Science时代的跨模态科学理解提供了关键基础资源,支持科学基础模型的开发以及广泛的下游科学智能应用。该数据集已公开提供,地址为https://huggingface.co/datasets/ScienceOne-AI/S1-MMAlign。

关键词

引用

@article{arxiv.2601.00264,
  title  = {S1-MMAlign: A Large-Scale, Multi-Disciplinary Dataset for Scientific Figure-Text Understanding},
  author = {He Wang and Longteng Guo and Pengkang Huo and Xuanxu Lin and Yichen Yuan and Jie Jiang and Jing Liu},
  journal= {arXiv preprint arXiv:2601.00264},
  year   = {2026}
}

备注

18 pages (main text) + 6 pages (supplementary information), 7 figures (main text). Updated version submitted to Scientific Data. Dataset available at https://huggingface.co/datasets/ScienceOne-AI/S1-MMAlign