通过计算机模拟反应数据增强提升逆合成预测
机器学习
2024-02-02 v1 人工智能
摘要
机器学习 (ML) 的最新进展通过帮助化学家更高效地设计实验,加速了逆合成研究。然而,所有基于 ML 的方法都消耗大量的成对训练数据(即化学反应:产物-反应物对),获取这些数据成本高昂。此外,公司将反应数据视为宝贵资产,并限制研究人员访问。这些问题阻碍了更强大的逆合成模型的创建,因为其本质是数据驱动的。作为回应,我们利用易于获取的非成对数据(即产物-反应物对中的一个组分)来生成计算机模拟的成对数据,以促进模型训练。具体来说,我们提出了 RetroWISE,一个自我增强框架,该框架采用从真实成对数据推断出的基础模型,利用非成对数据执行计算机模拟的反应生成和增强,最终产生一个更优的模型。在三个基准数据集上,RetroWISE 相较于最先进的模型取得了最佳的整体性能(例如,在 USPTO-50K 测试数据集上 top-1 准确率提升了 8.6%)。此外,它持续提高了稀有转化的预测准确率。这些结果表明,RetroWISE 通过计算机模拟反应克服了训练瓶颈,从而为更有效的基于 ML 的逆合成模型铺平了道路。
引用
@article{arxiv.2402.00086,
title = {Retrosynthesis prediction enhanced by in-silico reaction data augmentation},
author = {Xu Zhang and Yiming Mo and Wenguan Wang and Yi Yang},
journal= {arXiv preprint arXiv:2402.00086},
year = {2024}
}