SMILES Transformer:用于低数据药物发现的预训练分子指纹
机器学习
2019-11-13 v1 机器学习
摘要
在虚拟筛选等药物发现相关任务中,机器学习正成为一种有前景的分子性质预测方法。传统上,分子指纹(分子的数值表示)通过基于规则的算法计算,将分子映射到稀疏离散空间。然而,这些算法在浅层预测模型或小数据集上表现不佳。为解决此问题,我们提出 SMILES Transformer。受自然语言处理中 Transformer 与预训练语言模型的启发,SMILES Transformer 通过使用海量 SMILES(一种分子的文本表示系统)语料对序列到序列语言模型进行无监督预训练来学习分子指纹。我们在 10 个数据集上与现有指纹及基于图的方法进行了基准测试,并证明了所提算法在小数据设定下的优越性,其中预训练促进了良好的泛化。此外,我们定义了一种新度量,用以同时衡量模型精度与数据效率。
引用
@article{arxiv.1911.04738,
title = {SMILES Transformer: Pre-trained Molecular Fingerprint for Low Data Drug Discovery},
author = {Shion Honda and Shoi Shi and Hiroki R. Ueda},
journal= {arXiv preprint arXiv:1911.04738},
year = {2019}
}
备注
9 pages, 4 figures