面向 HPC 资源优化的 SLA-感知 多目标强化学习
机器学习
2025-08-06 v1
摘要
云环境中机器学习工作负载的动态资源分配仍具有挑战性,主要由于在满足服务等级协议 (SLA) 约束的同时,需要最小化训练时间和运营成本之间的竞争目标。传统方法采用静态资源分配或单目标优化,导致 SLA 违规或资源浪费。我们提出了 SLA-MORL,一种自适应的多目标强化学习框架,能够根据用户定义的偏好 (时间、成本或平衡) 智能分配 GPU 和 CPU 资源,同时确保 SLA 合规。我们的方法引入了两个关键创新:(1) 通过历史学习或高效基线运行实现的智能初始化,消除了冷启动问题,降低初始探索开销 60%;(2) 动态权重自适应调整,根据实时 SLA 违规严重程度自动调整优化优先级,构建自纠正系统。SLA-MORL 构建了 21 维的状态表示,捕获资源利用、训练进度和 SLA 合规情况,使 actor-critic 网络能够在 9 种可能的动作中做出明智的分配决策。针对 13 种多样化的 ML 工作负载进行了广泛评估,结果表明相对于静态基线,SLA-MORL 在截止时间关键任务中实现了 67.2% 训练时间减少,在预算受限工作负载中实现了 68.8% 成本减少,在整体 SLA 合规性方面实现了 73.4% 的改善。通过解决冷启动效率和动态适应性挑战,SLA-MORL 为云资源管理提供了实用解决方案,在现代 ML 训练环境中平衡性能、成本和可靠性。
引用
@article{arxiv.2508.03509,
title = {SLA-MORL: SLA-Aware Multi-Objective Reinforcement Learning for HPC Resource Optimization},
author = {Seraj Al Mahmud Mostafa and Aravind Mohan and Jianwu Wang},
journal= {arXiv preprint arXiv:2508.03509},
year = {2025}
}