训练集的遗传优化以改进分子性质的机器学习模型
计算物理
2016-11-28 v2 化学物理
摘要
基于统计机器学习的量子力学性质分子模型的训练需要大型数据集,这些数据集例示了从化学结构到分子性质的映射。由于先验知识可能稀疏或不可得,对训练示例进行智能的先验选择通常难以或无法实现。通常,从此类数据集中选择具有代表性的训练分子是通过随机采样实现的。我们使用遗传算法来优化由数万个小有机分子组成的训练集的构成。与小型随机选择的训练集相比,所得的机器学习模型显著更准确:对于焓、自由能和零点振动能,样本外预测的平均绝对误差降低至约25%;对于热容、电子展宽和极化率,降低至约50%;对于前沿轨道本征值或偶极矩等电子性质,降低超过约20%。我们讨论并展示了针对所有研究的分子性质、由10个分子类别组成的优化训练集。我们表明,这些类别可用于设计改进的训练集,以便在相似但不相关的分子集合中生成相同性质的机器学习模型。
引用
@article{arxiv.1611.07435,
title = {Genetic optimization of training sets for improved machine learning models of molecular properties},
author = {Nicholas J. Browning and Raghunathan Ramakrishnan and O. Anatole von Lilienfeld and Ursula Röthlisberger},
journal= {arXiv preprint arXiv:1611.07435},
year = {2016}
}
备注
9 pages, 6 figures