ProtGO:基于Transformer的融合模型,用于从全尺度蛋白质序列准确预测基因本体(GO)术语
机器学习
2024-12-10 v1 基因组学
摘要
下一代测序技术的最新发展催生了包含数亿条序列的广泛开源蛋白质数据库。为使这些序列适用于生物医学应用,必须通过湿实验仔细注释或从现有文献中提取。过去几年,研究人员开发了众多自动注释系统,特别是基于机器学习和人工智能的深度学习模型,以解决这一问题。在本工作中,我们提出了一种基于Transformer的融合模型,能够从全尺度蛋白质序列预测基因本体(GO)术语,与其他当代机器学习注释系统相比达到了最先进的精度。该方法在聚类分割数据集上表现尤为出色,这些数据集包含来自不同分布且结构多样的训练和测试样本。这表明该模型能够理解酶结构中的短期和长期依赖关系,并能够精确识别与各种GO术语相关的基序。此外,该技术轻量且计算成本低于基准方法,同时不受序列长度的影响,使其适用于序列长度各异的多样化应用。
引用
@article{arxiv.2412.05776,
title = {ProtGO: A Transformer based Fusion Model for accurately predicting Gene Ontology (GO) Terms from full scale Protein Sequences},
author = {Azwad Tamir and Jiann-Shiun Yuan},
journal= {arXiv preprint arXiv:2412.05776},
year = {2024}
}
备注
11 pages, 3 figures, 4 tables, This work would be submitted to Scientific journals for possible publication