中文

自驱动数据集:从2000万篇论文到大规模精细生物医学知识

机器学习 2026-05-19 v2

摘要

人工构建的生物医学知识库——涵盖生物活性、基因组和化学——维护成本高昂,滞后于原始文献,且丢弃了实验背景,掩盖了评估数据正确性和覆盖范围所需的细节。我们表明,PubMed 本身可以被自主且经济高效地转化为结构化数据集,这些数据集比其所替代的精选数据库规模更大、细节更丰富且更准确。我们提出三项耦合贡献:(1) 一个基于 LLM 的实体标注流水线,以九个生物医学本体为基础,在一个包含 2250 万篇论文、2.5T token 的 PubMed 语料库中跨 19 个类别标注了 45 亿个实体;(2) 混合稀疏-稠密检索,支持在标注语料库上进行实体过滤的语义查询;(3) Starling,一个多智能体深度研究系统,仅需给定自然语言任务描述,即可设计针对精确率和召回率的检索过滤器,推导提取模式,并输出包含丰富细节字段和支持段落的结构化记录。在六项任务中——血脑屏障通透性、口服生物利用度、急性毒性 (LD50)、基因-疾病关联、蛋白质亚细胞定位和化学反应——Starling 生成了约 630 万条记录(每项任务 9.1万至300万条不等);据我们所知,其中几项是针对其属性的最大公开数据集。前沿模型对我们提取结果的拒绝率在各项任务中介于 0.6% 至 7.7% 之间,远低于我们在广泛使用的精选对应数据集上测得的错误率(例如,BBB_Martins 上为 16.5%,Bioavailability_Ma 上为 7.3%)。除规模和准确性外,支持段落还保留了表格数据库所丢弃的细节——例如,口服生物利用度可能取决于进食与禁食状态。总之,该语料库、检索系统和智能体为 AI 驱动的治疗设计奠定了基础。代码和数据集:https://github.com/starling-labs/starling。

关键词

引用

@article{arxiv.2605.07022,
  title  = {Self-Driving Datasets: From 20 Million Papers to Nuanced Biomedical Knowledge at Scale},
  author = {Haydn Jones and Yimeng Zeng and Alden Rose and Li S. Yifei and Yining Huang and Kaiwen Wu and Jiaming Liang and Maggie Ziyu Huan and Yoseph Barash and Cesar de la Fuente-Nunez and Osbert Bastani and Zachary Ives and Mark Yatskar and Jacob R. Gardner},
  journal= {arXiv preprint arXiv:2605.07022},
  year   = {2026}
}