你的模型理解基因吗?一个面向生物和文本模型的基因属性基准
人工智能
2024-12-06 v1
摘要
近年来,深度学习方法,特别是基础模型,在生物研究中的应用激增。这些模型可以是基于文本的,也可以是在底层生物数据(尤其是各种类型的组学数据)上训练的。然而,由于训练数据和下游任务的差异,一致地比较这些模型的性能已被证明是一个挑战。为了解决这个问题,我们开发了一种与架构无关的基准测试方法,该方法不直接评估模型,而是利用每个模型的实体表示向量,并为每个基准测试任务训练简单的预测模型。这确保了所有类型的模型都使用相同的输入和输出类型进行评估。在这里,我们关注从专业管理的生物信息学数据库中收集的基因属性。这些基因属性被分为五大类:基因组属性、调控功能、定位、生物过程和蛋白质属性。总体而言,我们基于这些数据库定义了数百个任务,包括二分类、多标签和多类分类任务。我们应用这些基准任务来评估基于表达的模型、大语言模型、蛋白质语言模型、基于DNA的模型和传统基线模型。我们的发现表明,在基因组属性和调控功能任务中,基于文本的模型和蛋白质语言模型通常优于基于表达的模型,而基于表达的模型在定位任务中表现出优越的性能。这些结果应有助于为生物学理解和治疗发现开发更明智的人工智能策略。为确保我们研究结果的可重复性和透明度,我们已在github.com/BiomedSciAI/gene-benchmark上公开了源代码和基准数据,以供进一步研究和扩展。
引用
@article{arxiv.2412.04075,
title = {Does your model understand genes? A benchmark of gene properties for biological and text models},
author = {Yoav Kan-Tor and Michael Morris Danziger and Eden Zohar and Matan Ninio and Yishai Shimoni},
journal= {arXiv preprint arXiv:2412.04075},
year = {2024}
}