通过估算大规模化学计算资源来指导应用用户
机器学习
2025-09-26 v1 计算工程、金融与科学
分布式、并行与集群计算
摘要
本文发展了基于机器学习 (ML) 的策略,用于预测大规模化学计算所需资源(成本),例如耦合簇方法,以指导用户在在超级计算机上运行昂贵实验前做出决策。通过预测应用程序执行时间,我们确定最优运行参数值(如节点数和图块大小)。感兴趣的两个关键问题被解决。第一个是最短时间问题,用户想知道针对给定问题规模和目标超级计算机的参数组合(节点数和图块大小)以实现最短执行时间。第二个是最便宜运行问题,用户想最小化资源使用,即找到针对给定问题规模的节点数和图块大小以最小化节点小时数。我们评估了丰富的 ML 模型和策略,这些模型基于 CCSD(带单线和双线耦合簇)应用程序在美国能源部 (DOE) Frontier 和 Aurora 超级计算机上执行的运行时参数值。我们的实验表明,当预测 CCSD 迭代的总执行时间时,梯度提升 (GB) ML 模型在 Aurora 和 Frontier 上的平均绝对百分比误差分别为 0.023 和 0.073。当收集数据点昂贵时,我们表明主动学习可实现约 0.2 的 MAPE,仅需从 Aurora 和 Frontier 收集约 450 次实验。
引用
@article{arxiv.2509.20667,
title = {Guiding Application Users via Estimation of Computational Resources for Massively Parallel Chemistry Computations},
author = {Tanzila Tabassum and Omer Subasi and Ajay Panyala and Epiya Ebiapia and Gerald Baumgartner and Erdal Mutlu and P. and Sadayappan and Karol Kowalski},
journal= {arXiv preprint arXiv:2509.20667},
year = {2025}
}