一种用于分析机器学习势中参考数据与描述符的分箱与哈希方法
计算物理
2020-08-26 v1 其他凝聚态物理
摘要
近年来机器学习(ML)势(MLP)的发展已成为一个非常活跃的研究领域。人们提出了众多方法,使得能以电子结构计算极小一部分的计算成本对大系统进行扩展模拟。现代 ML 势成功的关键是对原子相互作用近乎第一性原理质量的刻画。这一精度是通过使用非常灵活的函数形式并结合来自电子结构计算的高层参考数据集实现的。这些数据集可包含多达数十万种结构、覆盖数百万个原子环境,以确保势能面的所有相关特征都得到良好表示。此类大型数据集的处理如今正成为构建 ML 势的主要挑战之一。在本文中,我们提出一种方法——分箱与哈希(BAH)算法,通过高效识别与比较大量多维向量来克服该问题。这类向量在 ML 势构建的多种情境中出现。例如:比较局域原子环境以识别并避免参考数据集中不必要冗余信息(无论对电子结构计算还是训练过程都代价高昂);评估作为多种 ML 势中结构指纹所用的描述符的质量;以及检测可能不可靠的数据点。BAH 算法以高维神经网络势为例进行说明,其中使用以原子为中心的对称函数进行原子环境的几何描述,但该方法具有通用性,可与任意当前类型的 ML 势结合。
引用
@article{arxiv.2008.10977,
title = {A Bin and Hash Method for Analyzing Reference Data and Descriptors in Machine Learning Potentials},
author = {Martín Leandro Paleico and Jörg Behler},
journal= {arXiv preprint arXiv:2008.10977},
year = {2020}
}