ProtVec:生物序列的连续分布式表示
定量方法
2016-05-30 v2 人工智能
机器学习
基因组学
摘要
我们提出了一种针对生物序列的新表示与特征提取方法。该方法统称为生物向量(BioVec),用于泛指各类生物序列;其中针对蛋白质(氨基酸序列)的称为蛋白质向量(ProtVec),针对基因序列的称为基因向量(GeneVec)。此表示法可广泛应用于蛋白质组学和基因组学中的深度学习任务。本文重点探讨蛋白质向量,其可应用于家族分类、蛋白质可视化、结构预测、无序蛋白鉴定以及蛋白质 - 蛋白质相互作用预测等多种生物信息学研究。在该方法中,我们采用人工神经网络方法,将蛋白质序列表示为单个稠密的 n 维向量。为评估该方法,我们将其应用于来自 Swiss-Prot 的 324,018 条蛋白质序列的分类任务,这些序列隶属于 7,027 个蛋白质家族,获得的平均家族分类准确率为 93%±0.06%,优于现有的家族分类方法。此外,我们利用 ProtVec 表示法预测无序蛋白与结构蛋白。使用了两个无序序列数据库:DisProt 数据库以及一个富含苯丙氨酸 - 甘氨酸重复序列(FG-Nups)的核孔蛋白无序区域数据库。利用支持向量机分类器,FG-Nup 序列与蛋白质数据库(PDB)中的结构蛋白序列的区分准确率达到 99.8%,而无序 DisProt 序列与结构 DisProt 序列的区分准确率达到 100.0%。这些结果表明,仅需向该模型提供各类蛋白质的序列数据,即可确定关于蛋白质结构的准确信息。
引用
@article{arxiv.1503.05140,
title = {ProtVec: A Continuous Distributed Representation of Biological Sequences},
author = {Ehsaneddin Asgari and Mohammad R. K. Mofrad},
journal= {arXiv preprint arXiv:1503.05140},
year = {2016}
}