中文

BABE:生物学竞技场基准

人工智能 2026-02-06 v1

摘要

大型语言模型(LLM)的快速演进已将其能力从基础对话拓展至高级科学推理。然而,现有生物学基准往往无法评估研究者所必需的关键技能:即将实验结果与背景知识整合以得出有意义结论的能力。为弥合这一差距,本文引入 BABE(Biology Arena BEnchmark),一个全面的基准,旨�评估生物学 AI 系统的实验推理能力。BABE 由同行评审研究论文和真实生物学研究构成,确保任务反映实际科学探究的复杂性和跨学科性。BABE 挑战模型进行因果推理和跨尺度推理。我们的基准为评估 AI 系统如何像从事从业科学家一样进行推理提供了稳健框架,为其在生物学研究中的潜在贡献提供了更真实的衡量。

关键词

引用

@article{arxiv.2602.05857,
  title  = {BABE: Biology Arena BEnchmark},
  author = {Junting Zhou and Jin Chen and Linfeng Hao and Denghui Cao and Zheyu Wang and Qiguang Chen and Chaoyou Fu and Jiaze Chen and Yuchen Wu and Ge Zhang and Mingxuan Wang and Wenhao Huang and Tong Yang},
  journal= {arXiv preprint arXiv:2602.05857},
  year   = {2026}
}