中文

利用异编码器改善化学自编码器潜空间及分子从头生成多样性

机器学习 2018-10-31 v2 机器学习

摘要

化学自编码器是一种有吸引力的模型,因为它们将化学空间导航与在感兴趣区域进行从头分子生成的可能性结合起来。这使得它们能够在药物发现项目早期围绕单一先导化合物生成聚焦的化学库。本文表明,化学表示(如 SMILES 字符串)的选择对潜空间的属性有很大影响。进一步探讨了在不同化学表示之间进行转换在多大程度上影响潜空间与 SMILES 字符串或圆形指纹的相似性。通过对编码器或解码器采用 SMILES 枚举,发现解码器对潜空间属性的影响最大。训练基于长短期记忆单元(LSTM)的循环神经网络(RNNs)的序列到序列异编码器,以从同一规范 SMILES 字符串预测不同的枚举 SMILES 字符串,使得潜空间距离与以圆形指纹相似性度量的分子相似性之间具有最大的相似性。在五个分子数据集的 QSAR 建模中使用瓶颈层输出表明,异编码器导出的向量明显优于自编码器导出的向量以及使用 ECFP4 指纹构建的模型,突显了潜空间化学相关性的增强。然而,在解码器训练期间使用枚举导致解码为与编码不同的分子的比率显著增加,这一趋势可通过更复杂的网络架构来抵消。

关键词

引用

@article{arxiv.1806.09300,
  title  = {Improving Chemical Autoencoder Latent Space and Molecular De novo Generation Diversity with Heteroencoders},
  author = {Esben Jannik Bjerrum and Boris Sattarov},
  journal= {arXiv preprint arXiv:1806.09300},
  year   = {2018}
}