通过语言模型自动化探索性蛋白质组学研究
人工智能
2024-11-07 v1 定量方法
摘要
随着人工智能的发展,其对科学的贡献正从模拟复杂问题演变为自动化整个研究过程并产生新发现。实现这一进步既需要基于真实科学数据的专用通用模型,也需要反映人类科学方法的迭代探索框架。在本文中,我们提出了 PROTEUS,一个从原始蛋白质组学数据进行科学发现的完全自动化系统。PROTEUS 使用大语言模型(LLMs)进行层次化规划、执行专门的生物信息学工具,并迭代优化分析工作流以生成高质量的科学假设。该系统以蛋白质组学数据集作为输入,无需人工干预即可生成一套完整的研究目标、分析结果和新生物学假设。我们在来自不同生物样本(如免疫细胞、肿瘤)和不同样本类型(单细胞和批量)的 12 个蛋白质组学数据集上评估了 PROTEUS,生成了 191 个科学假设。这些假设通过基于 LLM 的自动评分(5 个指标)和人类专家的详细评审进行了评估。结果表明,PROTEUS 始终产生可靠、逻辑连贯的结果,与现有文献吻合良好,同时也提出了新颖的、可评估的假设。该系统的灵活架构便于无缝集成多种分析工具并适应不同的蛋白质组学数据类型。通过自动化复杂的蛋白质组学分析工作流和假设生成,PROTEUS 有望显著加速蛋白质组学研究中的科学发现进程,使研究人员能够高效探索大规模数据集并揭示生物学见解。
引用
@article{arxiv.2411.03743,
title = {Automating Exploratory Proteomics Research via Language Models},
author = {Ning Ding and Shang Qu and Linhai Xie and Yifei Li and Zaoqu Liu and Kaiyan Zhang and Yibai Xiong and Yuxin Zuo and Zhangren Chen and Ermo Hua and Xingtai Lv and Youbang Sun and Yang Li and Dong Li and Fuchu He and Bowen Zhou},
journal= {arXiv preprint arXiv:2411.03743},
year = {2024}
}