中文

自动化专利提取驱动聚焦化学空间中的生成式建模

化学物理 2023-07-25 v3 机器学习

摘要

深度生成模型已成为逆向分子设计的一个令人振奋的途径,其进展来自训练算法与分子表示之间的相互作用。其在材料科学与化学中应用的关键挑战之一是缺乏带有性质标签的大规模训练数据集。已公开专利在期刊发表之前包含新材料的首次披露,是数据驱动分子设计领域中相对未被开发的科学知识巨大来源。由于专利申请旨在保护特定用途,专利中的分子可被视为弱标注到应用类别中。此外,美国专利商标局(USPTO)发布的专利可下载,并具有机器可读文本与分子结构。在本工作中,我们利用专利数据源训练领域特定的生成模型,开发了一条自动化流水线,从USPTO专利数字文件到生成新颖候选分子,仅需最少人工干预。我们在两个类内提取的数据集上测试该方法,一个为有机电子学,另一个为酪氨酸激酶抑制剂。然后我们评估在这些类内数据集上训练的生成模型在两类任务(分布学习与性质优化)上的能力,指出优势与局限,并给出可能的解释与在实践中克服这些问题的补救办法。

关键词

引用

@article{arxiv.2303.08272,
  title  = {Automated patent extraction powers generative modeling in focused chemical spaces},
  author = {Akshay Subramanian and Kevin P. Greenman and Alexis Gervaix and Tzuhsiung Yang and Rafael Gómez-Bombarelli},
  journal= {arXiv preprint arXiv:2303.08272},
  year   = {2023}
}

备注

Digital Discovery (2023)