面向宗基组数据的生物发现评估AI科学家的基准
人工智能
2026-01-21 v2 多智能体系统
基因组学
摘要
近期大型语言模型的进展推动了AI科学家涌现,这些AI科学家旨在自主分析生物数据并辅助科学发现。尽管取得了快速进展,但尚不清楚这些系统在从真实实验数据中提取有意义的生物见解的程度。现有的基准要么评估缺乏数据情境下的推理,要么侧重于预定义的分析输出,未能反映真实、数据驱动的生物研究。本文引入了BAISBench(Biological AI Scientist Benchmark),用于评估AI科学家在真实单细胞转录组数据集上的表现。BAISBench包含两个任务:跨15个专家标注数据集的细胞类型注释,以及通过从41项已发表的单细胞研究中提炼的193个多选题进行科学发现。我们评估了多个代表性AI科学家,并邀请六名博士生水平的生物信息学家共同完成相同的任务,以提供人类性能基准。结果表明,尽管当前的AI科学家在完全自主的生物发现方面仍有不足,但它们已经在支持数据驱动的生物研究方面显示出巨大的潜力。这些结果将BAISBench定位为实用基准,用于刻画AI科学家在生物研究中的当前能力和局限性。我们预计BAISBench将作为指导更强大AI科学家开发的实用评估框架,帮助生物学家识别能够有效支持实际研究工作流程的AI系统。BAISBench可在:https://github.com/EperLuo/BAISBench, https://huggingface.co/datasets/EperLuo/BaisBench 获取。
引用
@article{arxiv.2505.08341,
title = {Benchmarking AI scientists for omics data driven biological discovery},
author = {Erpai Luo and Jinmeng Jia and Yifan Xiong and Xiangyu Li and Xiaobo Guo and Baoqi Yu and Minsheng Hao and Lei Wei and Xuegong Zhang},
journal= {arXiv preprint arXiv:2505.08341},
year = {2026}
}