基于机器学习的高通量筛选
机器学习
2020-12-16 v1 化学物理
摘要
本研究评估了几种流行的机器学习方法在预测分子结合亲和力方面的效率:CatBoost、图注意力神经网络(Graph Attention Neural Network)和来自 Transformer 的双向编码器表示(Bidirectional Encoder Representations from Transformers)。这些模型被训练用于预测蛋白质与小有机分子对以抑制常数 表示的结合亲和力。前两种方法使用经过精细筛选的理化特征,而第三种方法基于文本分子表示——这是将基于 Transformer 的预测器应用于结合亲和力的首批尝试之一。我们还讨论了 Transformer 方法中注意力层的可视化,以突出负责相互作用的分子位点。所有方法均不依赖原子空间坐标,从而避免了已知结构带来的偏差,并能够对未知构象的化合物进行泛化。所有建议方法所达到的精度证明了它们在高通量筛选中的潜力。
引用
@article{arxiv.2012.08275,
title = {High throughput screening with machine learning},
author = {Oleksandr Gurbych and Maksym Druchok and Dzvenymyra Yarish and Sofiya Garkot},
journal= {arXiv preprint arXiv:2012.08275},
year = {2020}
}
备注
Presented at Machine Learning for Molecules Workshop @ NeurIPS 2020. 6 pages, 3 figures