中文

BioDSA-1K:面向生物医学研究的数据科学智能体基准测试

人工智能 2025-05-23 v1 计算与语言

摘要

验证科学假设是生物医学研究的核心挑战,由于现实世界数据分析和证据解释的复杂性,这对人工智能(AI)智能体而言依然困难。在本工作中,我们提出了 BioDSA-1K,一个旨在评估 AI 智能体在现实的、数据驱动的生物医学假设验证任务上表现的基准。BioDSA-1K 包含 1,029 个以假设为中心的任务,并配有 1,177 份分析计划,这些任务和计划整理自 300 多项已发表的生物医学研究,以反映真实研究工作流程中的结构和推理。每个任务都包含一个源自原始研究结论的结构化假设,并以肯定形式表述以反映科学报告的语言,以及一个或多个基于经验数据表的支持性证据。虽然这些假设反映了已发表的主张,但它们仍可使用标准的统计或机器学习方法进行检验。该基准支持沿四个轴进行评估:(1)假设决策准确性,(2)证据与结论之间的一致性,(3)推理过程的正确性,以及(4)AI 生成的分析代码的可执行性。重要的是,BioDSA-1K 包含了不可验证的假设:即现有数据不足以支持或反驳某个主张的情况,这反映了现实科学中一个常见但尚未被充分探索的场景。我们提出 BioDSA-1K 作为构建和评估用于生物医学发现的通用、可信赖 AI 智能体的基础。

关键词

引用

@article{arxiv.2505.16100,
  title  = {BioDSA-1K: Benchmarking Data Science Agents for Biomedical Research},
  author = {Zifeng Wang and Benjamin Danek and Jimeng Sun},
  journal= {arXiv preprint arXiv:2505.16100},
  year   = {2025}
}