中文

基于注意力机制的 CNN-BiLSTM 混合方法用于蛋白质家族分类 -- ProFamNet

定量方法 2024-10-24 v1 机器学习

摘要

先进的自动化 AI 技术使我们能够对蛋白质序列进行分类,以辨别其生物学家族和功能。常规方法通常侧重于从序列中提取 N-Gram 特征,而忽略关键 motifs 信息以及 motifs 与相邻氨基酸之间的相互作用。最近已将卷积神经网络应用于氨基酸和 motifs 数据,即使在数据集有限(即经良好特征化的蛋白质)的情况下也取得了改进性能。本研究提出一种模型,用于通过 1D-CNN、BiLSTM 与注意力机制的融合来分类蛋白质家族,这种方法结合了空间特征提取、长期依赖性和上下文感知表示。提出的模型(ProFamNet)以 450,953 个参数和紧凑的 1.72 MB 大小实现了卓越的模型效率,超过了具有 4,578,911 个参数和 17.47 MB 大小的最先进模型。进一步地,我们以更高的 F1 分数(98.30% vs. 97.67%)和更多实例(271,160 vs. 55,077)在更少的训练 epoch(25 vs. 30)中取得优异成绩。

关键词

引用

@article{arxiv.2410.17293,
  title  = {A Fusion-Driven Approach of Attention-Based CNN-BiLSTM for Protein Family Classification -- ProFamNet},
  author = {Bahar Ali and Anwar Shah and Malik Niaz and Musadaq Mansoord and Sami Ullah and Muhammad Adnan},
  journal= {arXiv preprint arXiv:2410.17293},
  year   = {2024}
}

备注

It is the authors original Work