大气分子簇建模的快速且可解释的机器学习方法
机器学习
2025-09-16 v1
摘要
理解大气分子簇如何形成和生长是解决气候建模中最大不确定性之一的关键:即新型气溶颗粒的形成。虽然量子化学提供了对这些早期簇的准确见解,但其高昂的计算成本限制了大规模探索。在本工作中,我们提出了一种快速、可解释且意想不到的强大的替代方案:-最近邻 (-NN) 回归模型。通过利用化学信息化的距离度量,包括内核诱导的度量以及通过度量学习进行内核回归 (MLKR) 学习的度量,我们显示,简单的 -NN 模型在准确性上可以与更复杂的核岭回归 (KRR) 模型相媲美,同时将计算时间缩短了多个数量级。我们使用广为人知的 Faber-Christensen-Huang-Lilienfeld (FCHL19) 分子描述符进行此比较,但其他描述符(例如 FCHL18、MBDF 和 CM)也可显示出类似的性能。应用于 QM9 小分子基准数据集和大型大气分子簇数据集(硫酸-水和硫酸-多碱-base 系统),我们的 -NN 模型实现了接近化学精度的性能,能够无缝扩展到拥有超过250,000条条目的大型数据集,并且甚至似乎能以最小误差(常常接近1 kcal/mol)对更大看不见的簇进行外推。凭借内置的可解释性和 straightforward 不确定性估计,本工作将 -NN 定位为加速大气化学及更广泛领域发现的有力工具。
引用
@article{arxiv.2509.11728,
title = {Fast and Interpretable Machine Learning Modelling of Atmospheric Molecular Clusters},
author = {Lauri Seppäläinen and Jakub Kubečka and Jonas Elm and Kai Puolamäki},
journal= {arXiv preprint arXiv:2509.11728},
year = {2025}
}
备注
38 pages with 2 page appendix, 9 figures. The source code used in the paper are available at https://github.com/edahelsinki/JK-kNN/