GP-GPT:面向基因-表型映射的大语言模型
计算与语言
2025-11-25 v4 人工智能
摘要
预训练的大语言模型(LLMs)因在自然语言处理领域的成功,受到越来越多的关注。然而,复杂的表型特征以及多源基因组数据的异质性,构成了将这些模型应用于生物信息学和医学基因组学领域的重大挑战。为此,我们提出了GP-GPT,这是第一个专注于基因-表型知识表示和基因组关系分析的专业大语言模型。该模型在由超过300万术语组成的综合语料库上进行双阶段微调,语料库来自多个大规模验证数据集和科学出版物,涵盖基因组学、蛋白质组学和医学遗传学。GP-GPT在准确检索医学遗传学信息和执行常见基因组分析任务(如基因组信息检索和关系确定)方面表现出色。与领域特定任务上的比较实验结果表明,GP-GPT在各项指标上均优于包括Llama2、Llama3和GPT-4在内的前沿大语言模型。这些结果凸显了GP-GPT在推动遗传疾病关系研究以及促进基因组学和医学遗传学领域准确高效分析方面的潜力。我们的调查显示,生物因子实体在GP-GPT中的表示方式存在细微变化,这为将LLMs应用于推进基因-表型研究提供了机遇。
引用
@article{arxiv.2409.09825,
title = {GP-GPT: Large Language Model for Gene-Phenotype Mapping},
author = {Yanjun Lyu and Zihao Wu and Lu Zhang and Jing Zhang and Yiwei Li and Wei Ruan and Zhengliang Liu and Zeyu Zhang and Xiang Li and Rongjie Liu and Chao Huang and Wentao Li and Tianming Liu and Dajiang Zhu},
journal= {arXiv preprint arXiv:2409.09825},
year = {2025}
}