基于目标与特征平均的动能密度机器学习:以更少训练数据获得更优结果
材料科学
2025-08-11 v3
摘要
动能泛函(KEF)特别是动能密度(KED)泛函的机器学习,近来作为构建无轨道密度泛函理论(OF-DFT)中KEF的一种有前景的方法而受到关注。神经网络(NN)和包括高斯过程回归(GPR)在内的核方法已被用于从基于密度的描述符中学习Kohn-Sham(KS)KED,这些描述符源自KS DFT计算。描述符通常表示为电子密度的不同幂次和导数的函数。这会产生庞大且分布极不均匀的数据集,给机器学习技术的有效应用带来困难。数据分布非常不均匀需要大量训练数据点,可能导致过拟合,并最终降低ML KED模型的质量。我们表明,通过对部分平均的依赖于密度的变量和KED进行处理,可以用更少的数据生成更精确的ML模型。平均缓解了数据分布极不均匀及相关采样困难的问题,同时保留了在KEDF范式内工作所需的足够空间结构。我们使用GPR作为部分空间平均的四阶梯度展开项与Kohn-Sham有效势的函数,仅用少至2000个样本(约占总KS DFT数据的0.3%)便同时获得了针对Al、Mg和Si的精确且稳定(相对于训练点的不同随机选取)的动能模型。特别地,在能量-体积依赖质量度量 B' = \frac{E(V_0-\Delta V)-2E(V_0)+E(V_0 + \Delta V)}{\big(\frac{\Delta V}{V_0}\big)^2} 上,对这三种材料同时获得了约1%量级的精度。
引用
@article{arxiv.2309.03482,
title = {Machine learning of kinetic energy densities with target and feature averaging: better results with fewer training data},
author = {Sergei Manzhos and Johann Lüder and Manabu Ihara},
journal= {arXiv preprint arXiv:2309.03482},
year = {2025}
}