中文

长期视角生物学的可验证基准测试

人工智能 2026-05-28 v1

摘要

AI 智能体在生物数据分析中日益实用,但现有基准测试大多测试广泛的生物学知识、可执行的工作流程或局部化分析步骤,而非对空间测量数据的端到端科学推理。我们引入 SpatialBench-Long,这是一个用于长期视角生物学的基准测试,要求智能体从原始或近原始数据和校准的实验背景中恢复生物学命题,无需指定方法。SpatialBench-Long 包含来自胰腺腺瘤(PDAC)、人工制造的胶质瘤器器化合物及体内肿瘤、Cas9 标记的肺腺瘤以及小鼠视神经老化/干预系统的 24 项评估,涵盖 CosMx、Visium、Xenium、多染色质鲁棒性荧光原位杂交 (MERFISH)、单细胞 RNA 测序 (scRNA-seq)、Slide-seq、Slide-tags、组织学及标记数据。候选命题经复现、独立科学家审阅和轨迹检查加固。最终答案在受控词汇表和符号下确定性评分,配以捕捉关键分析瓶颈的评分标准。在 SpatialBench-Long 基准测试中,三个模型-工具链组合以 8/72 项运行(11.1%)的成绩并列第一:Gemini 3.5 Flash / Pi 终端编码工具链、GPT-5.5 / Pi 以及 GPT-5.5 / OpenAI Codex。SpatialBench-Long 测试智能体是否能够超越执行程序化分析,仅依据复杂空间测量数据推导出准确的科学结论。

关键词

引用

@article{arxiv.2605.28065,
  title  = {Verifiable Benchmarking of Long-Horizon Spatial Biology},
  author = {Ian Diks and Harihara Muralidharan and Tim Proctor and Kenny Workman},
  journal= {arXiv preprint arXiv:2605.28065},
  year   = {2026}
}