中文

家族范围酶-底物特异性筛选的机器学习建模

生物大分子 2022-04-06 v1 机器学习

摘要

生物催化是一种以可持续方式大规模合成药物、复杂天然产物与大宗化学品的有前景的方法。然而,生物催化的采用受限于我们筛选能在非天然底物上催化其天然化学转化的酶的能力。尽管机器学习与计算机定向进化很适合这一预测建模挑战,迄今的努力主要旨在提高对单一已知底物的活性,而非识别能够对感兴趣的新底物起作用的酶。为满足该需求,我们从文献中整理了6套不同的高质量酶家族筛选数据,每套均测量多种酶对多种底物。我们比较了文献中用于预测药物-靶标相互作用的基于机器学习的化合物-蛋白质相互作用(CPI)建模方法。令人惊讶的是,将这些基于相互作用的模型与独立的(单任务)仅酶或仅底物模型集合相比较,揭示出当前的CPI方法在现有的家族水平数据规模下无法学习化合物与蛋白质之间的相互作用。我们通过证明我们的无相互作用基线能够胜过文献中用于指导激酶抑制剂发现的基于CPI的模型,进一步验证了该观察。鉴于基于非相互作用模型的优异性能,我们引入了一种新的基于结构的策略,用于在蛋白质序列上汇集残基表示。总之,本工作为构建并评估用于生物催化与其他药物发现应用的有意义预测模型指明了一条严谨的前进道路。

关键词

引用

@article{arxiv.2109.03900,
  title  = {Machine learning modeling of family wide enzyme-substrate specificity screens},
  author = {Samuel Goldman and Ria Das and Kevin K. Yang and Connor W. Coley},
  journal= {arXiv preprint arXiv:2109.03900},
  year   = {2022}
}