中文

机器学习原子间势能背景下实验的最优设计:提升基于核方法的效率与可迁移性

材料科学 2024-05-15 v1 机器学习

摘要

数据驱动的原子相互作用机器学习(ML)模型通常基于灵活且非物理的函数,这些函数能将原子排列的细微特征转化为能量和力的预测。因此,这些势能的优劣取决于训练数据(通常是所谓的第一性原理模拟结果),我们需要确保拥有足够的信息使模型变得足够准确、可靠且具有可迁移性。主要挑战在于,化学环境的描述符通常是缺乏明确定义连续度量的稀疏高维对象。因此,任何选择训练样本的临时方法都不太可能是无偏的,并且很容易陷入确认偏误的陷阱,即使用同样狭窄且有偏的采样来生成训练集和测试集。我们将证明,实验的经典统计规划与最优设计概念能够以相对较低的计算成本帮助缓解此类问题。我们将研究的方法的关键特征在于,它们允许我们在获取任何参考能量和力之前(即所谓的离线方法),评估数据的信息量(通过添加/替换训练样本能多大程度地改进模型),并验证当前数据集是否足以进行训练。换言之,我们关注的是一种易于实现的方法,且不需要涉及自动化访问高性能计算(HPC)的复杂框架。

关键词

引用

@article{arxiv.2405.08636,
  title  = {Optimal design of experiments in the context of machine-learning inter-atomic potentials: improving the efficiency and transferability of kernel based methods},
  author = {Bartosz Barzdajn and Christopher P. Race},
  journal= {arXiv preprint arXiv:2405.08636},
  year   = {2024}
}