“译中得解”:利用神经序列到序列模型预测复杂有机化学反应的结果
机器学习
2017-11-16 v2 机器学习
摘要
有机化学家对化合物的理解与语言使用者对单词的理解之间存在一种直观的类比。因此,可以引入语言学分析的基本概念并分析其对有机化学界的潜在影响。在这项工作中,我们将反应预测任务视为一个翻译问题,引入一种无模板的序列到序列模型,该模型以端到端、完全数据驱动的方式训练。我们提出了一种新颖的 tokenization(分词)方式,它可随反应信息任意扩展。通过该方法,我们在 top-1 准确率上以显著优势展示了优于最先进(SOTA)方案的结果。具体而言,我们的方法在不依赖反应模板等辅助知识的情况下达到了 80.1% 的准确率。此外,在更大且更嘈杂的数据集上达到了 66.4% 的准确率。
引用
@article{arxiv.1711.04810,
title = {"Found in Translation": Predicting Outcomes of Complex Organic Chemistry Reactions using Neural Sequence-to-Sequence Models},
author = {Philippe Schwaller and Theophile Gaudin and David Lanyi and Costas Bekas and Teodoro Laino},
journal= {arXiv preprint arXiv:1711.04810},
year = {2017}
}