中文

基于注意力神经机器翻译模型的逆合成及“错误”预测的化学分析

化学物理 2019-08-05 v1 机器学习

摘要

我们通过引入一种特殊的 Tensor2Tensor(一种完全基于注意力且完全数据驱动的模型)将逆合成视为机器翻译问题。给定一个包含约 50,000 条从 USPTO 专利中提取的多样化反应的数据集,该模型在 top-1 准确率上以 54.1% 显著优于 seq2seq 模型(34.7%)。为获得更好的结果,我们深入研究了批量大小和训练时间等参数来训练模型。此外,我们对语法无效 SMILES 的成因提供了新颖见解,并进行了一次测试,由经验丰富的化学家挑出并分析那些可能化学上合理但不同于真实值的“错误”预测。实际上,我们模型的有效性被低估了,“真实” top-1 准确率可达 64.6%。

关键词

引用

@article{arxiv.1908.00727,
  title  = {Retrosynthesis with Attention-Based NMT Model and Chemical Analysis of the "Wrong" Predictions},
  author = {Hongliang Duan and Ling Wang and Chengyun Zhang and Jianjun Li},
  journal= {arXiv preprint arXiv:1908.00727},
  year   = {2019}
}

备注

15 pages, 10 figures, 3 tables