面向机器学习力场的基于多核图自编码器的无监督原子数据挖掘
机器学习
2025-09-17 v1 材料科学
摘要
构建化学多样性数据集同时避免采样偏差,对于训练高效且具泛化能力的力场至关重要。然而,在计算化学和材料科学中,许多常见的数据集生成技术容易对势能面的某些区域进行过采样。此外,这些区域可能难以识别和相互分离,或者可能与人类直觉不符,这使得系统地消除数据集中的偏差具有挑战性。虽然传统的聚类和剪枝(下采样)方法对此可能有用,但由于原子描述符的高维性带来的困难,它们通常会导致信息丢失或无法正确识别势能面的不同区域。在这项工作中,我们引入了多核边注意力图自编码器(MEAGraph)模型,这是一种用于分析原子数据集的无监督方法。MEAGraph 将多种线性核变换与基于注意力的消息传递相结合,以捕捉几何敏感性,并在不依赖标签或大量训练的情况下实现有效的数据集剪枝。在铌、钽和铁数据集上的应用表明,MEAGraph 能高效地将相似的原子环境分组,从而允许使用基本剪枝技术来消除采样偏差。这种方法提供了一种有效的表示学习和聚类方法,可用于数据分析、异常检测和数据集优化。
引用
@article{arxiv.2509.12358,
title = {Unsupervised Atomic Data Mining via Multi-Kernel Graph Autoencoders for Machine Learning Force Fields},
author = {Hong Sun and Joshua A. Vita and Amit Samanta and Vincenzo Lordi},
journal= {arXiv preprint arXiv:2509.12358},
year = {2025}
}