通过结合监督与无监督机器学习改进构型空间中的分子力场
化学物理
2021-03-24 v1
摘要
原子构型的训练集是任何机器学习力场(MLFF)性能的关键,因此训练集的选择决定了 MLFF 模型在预测性分子模拟中的适用性。然而,大多数原子级参考数据集在构型空间(CS)中分布不均匀,从而随机地或依据数据概率分布选择训练集会导致模型的精度主要由参考数据中最常见的近平衡构型决定。在本工作中,我们结合无监督与监督 ML 方法来绕过数据对常见构型的固有偏置,有效地将 MLFF 的适用范围拓宽至数据集的最大能力。为实现此目标,我们首先将 CS 按几何与能量学上的相似性聚类为子区域。我们迭代测试给定 MLFF 在每个子区域上的性能,并用 CS 中最不准确部分的代表点填充模型的训练集。所提方法已应用于一组小有机分子和丙氨酸四肽,显示出这些分子的力预测均方根误差降低多达两倍。该结果对基于核的方法(sGDML 和 GAP/SOAP 模型)和深度神经网络(SchNet 模型)均成立。对于后者,所发展方法同时改进了能量与力,绕过了采用能量/力混合损失函数时需做的折中。
引用
@article{arxiv.2103.01674,
title = {Improving Molecular Force Fields Across Configurational Space by Combining Supervised and Unsupervised Machine Learning},
author = {Gregory Fonseca and Igor Poltavsky and Valentin Vassilev-Galindo and Alexandre Tkatchenko},
journal= {arXiv preprint arXiv:2103.01674},
year = {2021}
}