原子级学习的善、恶与丑:从“簇到批量”的泛化
化学物理
2025-09-23 v1 材料科学
摘要
使用差分学习或迁移学习在分子簇的总能量上训练机器学习原子势能 (MLIPs) 正变得流行,以将相关波函数理论的准确性扩展到凝胶相。然而,一个关键挑战在于验证,因为在有限温度集合中参考可观测量在参考层级不可得。本文我们使用预训练的 MLIPs 生成合成参考数据,并评估基于簇训练的模型在 ice-Ih 上的泛化性,考虑两种情形:一种是能量和力都可用,另一种是仅有能量可用。我们研究差分学习、单保真度迁移学习和多保真度迁移学习在能量和力上的准确性和数据效率与 ground-truth 热力学可观测量之间的关系。我们发现,将准确性从簇转移到批量需要正则化,在训练能量和力时通过多保真度迁移学习实现这一点最为理想。相比之下,仅训练能量会引入人为误差:稳定的轨迹和低能量误差掩盖了较大的力误差,导致微观可观测量不准确。更广泛地说,我们表明,微观结构的准确再现与低力误差强相关,但仅与能量误差弱相关,而全局属性如能量和密度则与低能量误差相关。这一发现突显了在训练期间纳入力或在生产前进行小心验证的必要性。我们的结果凸显了基于簇的 MLIPs 在凝胶相中的潜力与陷阱,并为开发和关键、严格验证稳健且数据高效的 MLIPs 提供了指南。
引用
@article{arxiv.2509.16601,
title = {The Good, the Bad, and the Ugly of Atomistic Learning for "Clusters-to-Bulk" Generalization},
author = {Mikołaj J. Gawkowski and Mingjia Li and Benjamin X. Shi and Venkat Kapil},
journal= {arXiv preprint arXiv:2509.16601},
year = {2025}
}