中文

通过估算大规模化学计算资源来指导应用用户

机器学习 2025-09-26 v1 计算工程、金融与科学 分布式、并行与集群计算

摘要

本文发展了基于机器学习 (ML) 的策略,用于预测大规模化学计算所需资源(成本),例如耦合簇方法,以指导用户在在超级计算机上运行昂贵实验前做出决策。通过预测应用程序执行时间,我们确定最优运行参数值(如节点数和图块大小)。感兴趣的两个关键问题被解决。第一个是最短时间问题,用户想知道针对给定问题规模和目标超级计算机的参数组合(节点数和图块大小)以实现最短执行时间。第二个是最便宜运行问题,用户想最小化资源使用,即找到针对给定问题规模的节点数和图块大小以最小化节点小时数。我们评估了丰富的 ML 模型和策略,这些模型基于 CCSD(带单线和双线耦合簇)应用程序在美国能源部 (DOE) Frontier 和 Aurora 超级计算机上执行的运行时参数值。我们的实验表明,当预测 CCSD 迭代的总执行时间时,梯度提升 (GB) ML 模型在 Aurora 和 Frontier 上的平均绝对百分比误差分别为 0.023 和 0.073。当收集数据点昂贵时,我们表明主动学习可实现约 0.2 的 MAPE,仅需从 Aurora 和 Frontier 收集约 450 次实验。

关键词

引用

@article{arxiv.2509.20667,
  title  = {Guiding Application Users via Estimation of Computational Resources for Massively Parallel Chemistry Computations},
  author = {Tanzila Tabassum and Omer Subasi and Ajay Panyala and Epiya Ebiapia and Gerald Baumgartner and Erdal Mutlu and P. and Sadayappan and Karol Kowalski},
  journal= {arXiv preprint arXiv:2509.20667},
  year   = {2025}
}