中文

用于直接与单步逆合成的最先进增强型 NLP Transformer 模型

机器学习 2021-01-27 v2 机器学习

摘要

我们研究了不同训练场景对使用化学反应的类文本表示(SMILES)和自然语言处理神经网络 Transformer 架构预测化合物(逆)合成的影响。我们表明,数据增强这一在图像处理中使用的强大方法,消除了神经网络对数据记忆的影响,并提升了其预测新序列的性能。当增强同时用于输入和目标数据时观察到该效果。对于 USPTO-50k 测试数据集,预测最大片段(从而识别经典逆合成的主要转化)的 top-5 准确率为 84.8%,由 SMILES 增强与束搜索算法组合实现。相同方法在单步 USPTO-MIT 测试集的直接反应预测上提供了显著更好的结果。我们的模型在其具有挑战性的混合集上实现了 90.6% 的 top-1 和 96.1% 的 top-5 准确率,在 USPTO-MIT 分离集上实现了 97% 的 top-5 准确率。它还在 USPTO-full 集单步逆合成的 top-1 和 top-10 准确率上显著改进了结果。生成最频繁的 SMILES 的出现频率与预测结果良好相关,可用作反应预测质量的度量。

关键词

引用

@article{arxiv.2003.02804,
  title  = {State-of-the-Art Augmented NLP Transformer models for direct and single-step retrosynthesis},
  author = {Igor V. Tetko and Pavel Karpov and Ruud Van Deursen and Guillaume Godin},
  journal= {arXiv preprint arXiv:2003.02804},
  year   = {2021}
}