中文

SMILES枚举作为分子神经网络建模的数据增强

机器学习 2017-05-18 v2

摘要

简化分子输入行输入系统(SMILES)是独特分子的单行文本表示。然而,一个分子可以有多个SMILES字符串,这正是定义规范SMILES的原因,它确保了SMILES字符串与分子之间的一一对应。本文探索了利用多个SMILES表示同一分子这一事实,作为基于长短期记忆(LSTM)单元神经网络建模的分子QSAR数据集的数据增强技术。增强后的数据集比原始数据集大130倍。与使用每个分子仅一个规范SMILES字符串构建的模型相比,用增强数据集训练的网络在测试集上表现出更好的性能。使用SMILES枚举时,测试集上的相关系数R2从0.56提高到0.66,均方根误差(RMS)同样从0.62降至0.55。该技术在预测阶段也有效。通过对枚举SMILES的预测结果按分子取平均,进一步将相关系数提高到0.68,RMS降至0.52。

关键词

引用

@article{arxiv.1703.07076,
  title  = {SMILES Enumeration as Data Augmentation for Neural Network Modeling of Molecules},
  author = {Esben Jannik Bjerrum},
  journal= {arXiv preprint arXiv:1703.07076},
  year   = {2017}
}