化学反应数据集的无辅助降噪
机器学习
2021-02-03 v1 人工智能
摘要
现有应用于有机化学中反应预测的深度学习模型可达到较高的准确率(基于自然语言处理的模型超过 90%)。由于除从反应数据中学到的信息外未嵌入化学知识,数据集的质量在预测模型的性能中起着关键作用。虽然人工整理成本高昂,但亟需无辅助方法从现有数据集中移除化学上不正确的条目,以提升人工智能模型在合成化学任务中的性能。在此我们提出一种基于机器学习、无辅助的方法,从化学反应集合中移除化学错误的条目。我们将该方法应用于从 USPTO(美国专利局)专利中提取的 Pistachio 化学反应集合以及一个开放数据集。我们的结果显示,在清洗并平衡的数据集上训练的模型预测质量得到提升。对于逆合成模型,往返准确率指标提升了 13 个百分点,累积 Jensen Shannon 散度值较原始记录下降了 30%。覆盖率保持在 97% 的高水平,且类别多样性的值不受清洗影响。所提出的策略是首个解决化学数据集中自动降噪的无辅助无规则技术。
引用
@article{arxiv.2102.01399,
title = {Unassisted Noise Reduction of Chemical Reaction Data Sets},
author = {Alessandra Toniato and Philippe Schwaller and Antonio Cardinale and Joppe Geluykens and Teodoro Laino},
journal= {arXiv preprint arXiv:2102.01399},
year = {2021}
}