中文

scBench-Long:长视野单细胞生物学的可验证基准测试

基因组学 2026-06-25 v1 人工智能

摘要

单细胞研究要求分析人员通过多步骤工作流程以及元数据、检测环境和辅助证据的整合,将原始测量结果转化为特定的生物学结论。现有的AI-生物学基准主要衡量广泛知识、可执行工作流程或局部分析步骤。我们介绍了scBench-Long,一个用于长视野单细胞生物学的基准,其中智能体必须从原始或接近原始的数据中恢复科学结论,而无需规定方法。该基准包含21项评估,涵盖黑色素瘤CD8 T细胞反应性、CD8 RNA+ATAC调控推断、人-猴嵌合体发育、KRAS驱动的肺肿瘤衰老和致死性COVID-19肺部病理。任务涵盖配对的scRNA/TCR测序、RNA和染色质分析、跨物种转录组学、组合scRNA-seq、单核RNA-seq、免疫组库、直系同源图谱、配体-受体资源和验证证据。候选声明被重现、审查并转换为受控答案词汇表,具有确定性评分和轨迹规则。在1,068条完成的轨迹中,最强的模型-工具组合通过了16/63次运行(25.4%)。scBench-Long评估智能体是否能超越局部分析步骤,做出由单细胞数据支持的复杂科学声明。

关键词

引用

@article{arxiv.2606.26563,
  title  = {scBench-Long: Verifiable Benchmarking of Long-Horizon Single-Cell Biology},
  author = {Ian Diks and Zhen Yang and Arjun Banerjee and Tim Proctor and Kenny Workman},
  journal= {arXiv preprint arXiv:2606.26563},
  year   = {2026}
}