中文

DNA编码化合物库上的部分产物感知机器学习

机器学习 2022-05-18 v1 定量方法

摘要

DNA编码化合物库(DEL)用于针对蛋白质靶标进行小分子的快速大规模筛选。这些组合化合物库通过多个周期的化学合成与DNA连接构建,产生大量DNA标记的分子集合。已有研究表明,在DEL数据上训练机器学习模型能有效预测与原始DEL中不相似的目标分子。机器学习的化学性质预测方法依赖于这样一个假设:所关注的性质与单一化学结构相关联。在DNA编码化合物库的语境下,这等价于假设每个化学反应都能完全生成目标产物。然而,在实际中,多步化学合成有时会生成部分分子。因此,DEL中每个独特的DNA标签对应一组可能的分子。在此,我们利用反应产率数据来枚举给定DNA标签对应的一组可能分子。本文表明,在此更丰富的数据集上训练定制的GNN能提升准确率与泛化性能。

关键词

引用

@article{arxiv.2205.08020,
  title  = {Partial Product Aware Machine Learning on DNA-Encoded Libraries},
  author = {Polina Binder and Meghan Lawler and LaShadric Grady and Neil Carlson and Sumudu Leelananda and Svetlana Belyanskaya and Joe Franklin and Nicolas Tilmans and Henri Palacci},
  journal= {arXiv preprint arXiv:2205.08020},
  year   = {2022}
}

备注

8 pages, 5 figures; Published at the MLDD workshop, ICLR 2022