中文

SC-Arena:面向单细胞推理的自然语言基准测试框架

人工智能 2026-02-27 v1

摘要

大型语言模型(LLMs)正在被广泛应用于科学研究,为知识发现和推理提供了新能力。在单细胞生物学中,然而,针对通用和领域专门LLMs的评估实践仍不充分:现有基准测试在任务上碎片化,采用诸如多选分类等格式,与实际使用场景背离,并依赖缺乏可解释性和生物学依托的指标。我们提出SC-ARENA,一个针对单细胞基础模型的自然语言评估框架。SC-ARENA在虚拟细胞抽象范式下统一评估目标,通过表示细胞的内在属性和基因水平的相互作用。我们定义了五个自然语言任务(细胞类型标注、描述、生成、扰动预测和科学问答),以探测细胞生物学中核心推理能力。为了克服脆弱字符串匹配指标的局限,我们引入知识增强评估,融合外部本体、标记数据库和科学文献,以支持生物学忠实且可解释的判断。跨通用和领域专门LLMs的实验与分析表明:(i)在虚拟细胞统一评估范式下,当前模型在生物学复杂任务上的表现不均,尤其是那些要求机制或因果理解的任务;(ii)我们的知识增强评估框架确保生物学正确性,提供可解释、以证据为依托的理由,并实现高辨识度,克服了常规指标的脆弱性和不透明性。SC-Arena因此为评估单细胞生物学中的LLMs提供了一个统一且可解释的框架,指向发展与生物学相吻合、可泛化的基础模型。

关键词

引用

@article{arxiv.2602.23199,
  title  = {SC-Arena: A Natural Language Benchmark for Single-Cell Reasoning with Knowledge-Augmented Evaluation},
  author = {Jiahao Zhao and Feng Jiang and Shaowei Qin and Zhonghui Zhang and Junhao Liu and Guibing Guo and Hamid Alinejad-Rokny and Min Yang},
  journal= {arXiv preprint arXiv:2602.23199},
  year   = {2026}
}