中文

源自开放科学文献的大规模视觉-语言数据集:推动生物医学通用人工智能

计算与语言 2025-04-03 v2 机器学习

摘要

尽管生物医学人工智能(AI)备受期待,但获取高质量、多样且大规模的数据——现代AI系统的基础——仍是阻碍其潜力的瓶颈。为此,我们引入Biomedica数据集,源自PubMed Central开放获取子集,包含超过600万篇科学文章和2400万张图像-文本对,以及27个元数据字段(包括专家人工标注)。为克服获取大规模数据集的挑战,我们通过Web服务器提供可扩展的流式访问和搜索API,便于无缝集成到AI系统中。我们通过构建嵌入模型、聊天式模型和检索增强型聊天代理来展示Biomedica数据集的实用性。值得注意的是,我们的所有AI模型在各自类别中均超越了以往的开放系统,凸显了多样性、高质量和大规模生物医学数据的关键作用。

关键词

引用

@article{arxiv.2503.22727,
  title  = {A Large-Scale Vision-Language Dataset Derived from Open Scientific Literature to Advance Biomedical Generalist AI},
  author = {Alejandro Lozano and Min Woo Sun and James Burgess and Jeffrey J. Nirschl and Christopher Polzak and Yuhui Zhang and Liangyu Chen and Jeffrey Gu and Ivan Lopez and Josiah Aklilu and Anita Rau and Austin Wolfgang Katzer and Collin Chiu and Orr Zohar and Xiaohan Wang and Alfred Seunghoon Song and Chiang Chia-Chun and Robert Tibshirani and Serena Yeung-Levy},
  journal= {arXiv preprint arXiv:2503.22727},
  year   = {2025}
}