中文

HMD-AMP:基于蛋白质语言的层次化多标签深度森林用于抗菌肽注释

机器学习 2021-11-12 v1 人工智能 定量方法

摘要

识别抗菌肽的靶标是研究先天免疫反应和对抗抗生素耐药性的基本步骤,更广泛地说,是精准医学和公共卫生的基础。已有大量统计和计算方法研究用于识别(i)肽是否是抗菌肽(AMP)或非AMP,以及(ii)这些序列对哪些靶标有效(革兰氏阳性、革兰氏阴性等)。尽管已有针对该问题的深度学习方法,但大多数方法无法处理小类AMP(抗昆虫、抗寄生虫等)。更重要的是,一些AMP可能具有多个靶标,而以前的方法未能考虑这一点。在本研究中,我们通过收集和清理来自各种AMP数据库的氨基酸序列,构建了一个多样且全面的多标签蛋白质序列数据库。为了为小类数据集生成有效的表示和特征,我们利用了在2.5亿条蛋白质序列上训练的蛋白质语言模型。在此基础上,我们开发了一个端到端的层次化多标签深度森林框架HMD-AMP,用于全面注释AMP。在识别出AMP后,它进一步预测该AMP可以有效杀死的靶标(从11个可用类别中)。大量实验表明,我们的框架在二分类任务和多标签分类任务中均优于最先进的模型,尤其是在小类上。该模型对特征减少和小扰动具有鲁棒性,并产生了有希望的结果。我们相信HMD-AMP有助于未来对不同抗菌肽固有结构特性的湿实验研究,并为抗生素精准医学建立有希望的经验基础。

关键词

引用

@article{arxiv.2111.06023,
  title  = {HMD-AMP: Protein Language-Powered Hierarchical Multi-label Deep Forest for Annotating Antimicrobial Peptides},
  author = {Qinze Yu and Zhihang Dong and Xingyu Fan and Licheng Zong and Yu Li},
  journal= {arXiv preprint arXiv:2111.06023},
  year   = {2021}
}

备注

16 pages 8 figures