中文

代数拓扑在基于机器学习的评分与虚拟筛选中生物分子表征的应用

定量方法 2018-02-07 v1 生物大分子

摘要

本工作引入多种代数拓扑方法,如多分量持续同调、多层次持续同调和静电持续性,用于小分子与生物分子复合物的表示、刻画与描述。多分量持续同调在生物分子几何复杂性的拓扑简化过程中保留了关键化学与生物信息。多层次持续同调能够对感兴趣的分子间和/或分子内相互作用进行量身定制的拓扑描述。静电持续性将部分电荷信息融入拓扑不变量。这些拓扑方法与 Wasserstein 距离相结合以刻画分子间的相似性,并进一步与多种机器学习算法(包括 k 近邻、树集成和深度卷积神经网络)相整合,以展现其在化学与生物学问题上的描述与预测能力。我们进行了广泛的数值实验,涉及来自 PDBBind 数据库的 4,000 多个蛋白质-配体复合物以及 DUD 数据库中近 100,000 个配体与诱饵,分别测试所提拓扑方法的评分能力与虚拟筛选能力。结果表明,本方法在蛋白质-配体结合亲和力预测与配体-诱饵区分方面优于现代基于机器学习的方法。

关键词

引用

@article{arxiv.1708.08135,
  title  = {Representability of algebraic topology for biomolecules in machine learning based scoring and virtual screening},
  author = {Zixuan Cang and Lin Mu and Guowei Wei},
  journal= {arXiv preprint arXiv:1708.08135},
  year   = {2018}
}