改进基于 VAE 的分子表示以提升化合物性质预测
机器学习
2022-05-20 v3
摘要
为化学信息学中的许多重要任务收集标注数据耗时且需要昂贵实验。近年来,机器学习已被用于利用大规模无标注分子数据集学习分子的丰富表示,并将知识迁移以解决数据有限更具挑战性的任务。变分自编码器是被提出用于化学性质预测和分子生成任务执行迁移的工具之一。本工作中,我们提出一种简单方法,通过在变分自编码器学习的表示中融入相关分子描述符的附加信息,来改进机器学习模型的化学性质预测性能。我们在三个性质预测任务上验证了该方法。我们探究了所融入描述符数量、描述符与目标性质间相关性、数据集规模等的影响。最后,我们展示了性质预测模型性能与性质预测数据集和较大无标注数据集在表示空间中距离的关系。
引用
@article{arxiv.2201.04929,
title = {Improving VAE based molecular representations for compound property prediction},
author = {A. Tevosyan and L. Khondkaryan and H. Khachatrian and G. Tadevosyan and L. Apresyan and N. Babayan and H. Stopper and Z. Navoyan},
journal= {arXiv preprint arXiv:2201.04929},
year = {2022}
}