面向高性能计算集群作业结果预测的特征选择及其在决策支持中的应用
机器学习
2020-12-16 v1 人工智能
摘要
我们提出了一个机器学习框架和一个用于从高性能计算(HPC)集群的 Slurm 工作负载管理器中进行数据挖掘的新测试平台。重点在于寻找一种用于支持决策的特征选择方法:帮助用户决定是否以增加的 CPU 和内存分配重新提交失败作业,或将其迁移至计算云。该任务被建模为监督分类与回归学习,具体而言,是适用于强化学习的序贯问题求解。选择相关特征可提升训练精度、缩短训练时间,并生成更具可解释性的模型,使智能系统能够解释预测与推断。我们提出一个监督学习模型,基于 Slurm(Simple Linux Utility for Resource Management)的 HPC 作业数据集,使用三种不同特征选择技术进行训练:线性回归、套索(lasso)回归与岭回归。我们的数据集同时包含失败与成功的 HPC 作业,因此模型可靠、不易过拟合且可泛化。我们的模型取得了 95% 的 R^2 与 99% 的准确率。我们识别出 CPU 与内存属性各自的五个预测因子。
引用
@article{arxiv.2012.07982,
title = {Feature Selection for Learning to Predict Outcomes of Compute Cluster Jobs with Application to Decision Support},
author = {Adedolapo Okanlawon and Huichen Yang and Avishek Bose and William Hsu and Dan Andresen and Mohammed Tanash},
journal= {arXiv preprint arXiv:2012.07982},
year = {2020}
}
备注
6 pages, Proceedings of the International Conference on Computational Science and Computational Intelligence Symposium on Parallel & Distributed Computing (CSCI-ISPD 2020)