中文

保持简洁:语言模型能够学习复杂分子分布

机器学习 2023-05-11 v1 人工智能 定量方法

摘要

分子的深度生成模型已极具流行度,这些模型在相关数据集上训练后,被用于搜索化学空间。生成模型用于新颖功能化合物逆向设计的下游效用,取决于其学习分子训练分布的能力。最简单的例子是采用循环神经网络形式的语言模型,并使用字符串表示生成分子。更复杂的是图生成模型,其顺序构建分子图,通常取得最先进的(state of the art)结果。然而,近期工作表明语言模型比曾经认为的更具能力,尤其在低数据 regime。本工作中,我们研究简单语言模型学习分子分布的能力。为此,我们通过编译尤其复杂的分子分布,引入若干具有挑战性的生成建模任务。在每个任务上,我们评估语言模型与两种广泛使用的图生成模型的能力比较。结果表明语言模型是强大的生成模型,能够熟练学习复杂分子分布——并且取得优于图模型的性能。语言模型可准确生成:ZINC15中得分最高的惩罚LogP分子的分布、多模态分子分布以及PubChem中最大的分子。

关键词

引用

@article{arxiv.2112.03041,
  title  = {Keeping it Simple: Language Models can learn Complex Molecular Distributions},
  author = {Daniel Flam-Shepherd and Kevin Zhu and Alán Aspuru-Guzik},
  journal= {arXiv preprint arXiv:2112.03041},
  year   = {2023}
}