LiveProteinBench:一个用于评估模型在蛋白质科学中专业能力的无污染基准
定量方法
2025-12-30 v1
摘要
与在通用知识问答上的卓越表现相比,大语言模型在需要深度、专业推理的任务(如蛋白质生物学)中的真实能力尚未得到彻底研究。当前的基准存在关键缺陷,例如由于测试集过时而导致的数据污染、对基本蛋白质特定任务的关注不足,以及忽视多模态评估。为了解决这些问题,我们引入了LiveProteinBench,这是一个无污染的多模态基准,包含12个任务,用于评估大语言模型在蛋白质性质和功能预测方面的性能。其核心创新在于测试集完全由2025年之后才被验证的蛋白质组成,保证了数据对所有被测试模型都是新颖的。我们使用单模态和多模态输入方案,对一系列著名的通用大语言模型和专门的生物学大语言模型进行了基准测试。我们的结果表明:1) 通用专有大型模型在遇到新的蛋白质数据时表现出优越的零样本性能,其准确率比开源和领域特定模型高出20%以上。2) 有效利用多视图结构信息仍然是一个重大挑战,因为包含结构图像通常无法提供一致的好处,甚至可能降低性能。这突显了当前模型在有效融合不同模态信息方面的局限性。3) 模型的性能与推理过程中的计算成本更直接相关,而非其参数数量,这强调了思维链推理能力对于蛋白质特定任务的关键作用。LiveProteinBench描绘了大语言模型在生物信息学中的当前性能前沿,并为未来生物学多模态基础模型的发展提出了新的挑战。
引用
@article{arxiv.2512.22257,
title = {LiveProteinBench: A Contamination-Free Benchmark for Assessing Models' Specialized Capabilities in Protein Science},
author = {Dingyi Rong and Zijian Chen and Qi Jia and Kaiwei Zhang and Haotian Lu and Guangtao Zhai and Ning Liu},
journal= {arXiv preprint arXiv:2512.22257},
year = {2025}
}