中文

比较两种基于深度学习序列的蛋白质-蛋白质相互作用预测模型

机器学习 2019-01-21 v1 定量方法 机器学习

摘要

生物学数据极其多样、复杂但也相当稀疏。深度学习方法的最新进展为复杂数据的分析提供了新的可能性。然而,很容易得到一个看似结果良好但实际上要么过拟合了训练数据要么过拟合了验证数据的深度学习模型。特别是,过拟合验证数据这一事实被称为“信息泄漏”,在提出用于预测蛋白质-蛋白质相互作用(PPI)的深度学习模型的论文中几乎从未被处理过。在这项工作中,我们比较了两个精心设计的深度学习模型,并展示了通过机器学习方法预测 PPI 时应避免的陷阱。我们最佳的模型在训练和测试条件都非常严格的情况下,准确预测了超过 78% 的人类 PPI。我们在此提出的方法论使我们对模型在更大规模数据集上的扩展能力具有高度信心。这将使得在更大规模数据集可用时能够构建更精准的模型,而不是像当前模型那样容易发生信息泄漏。我们坚实的方法论基础应可适用于更多生物体和全蛋白质组网络预测。

关键词

引用

@article{arxiv.1901.06268,
  title  = {Comparing two deep learning sequence-based models for protein-protein interaction prediction},
  author = {Florian Richoux and Charlène Servantie and Cynthia Borès and Stéphane Téletchéa},
  journal= {arXiv preprint arXiv:1901.06268},
  year   = {2019}
}