中文

Predict-and-Critic:通过强化学习实现云计算的加速端到端预测控制

机器学习 2023-02-28 v2

摘要

云计算有望通过规模经济降低成本。为实现此前景,云计算供应商通常求解序贯资源分配问题,即将客户工作负载打包于共享硬件上。虚拟机(VM)构成现代云计算的基础,因其有助于将用户计算从共享物理基础设施中逻辑抽象。传统上,VM 打包问题通过预测需求、随后在未来时域上作模型预测控制(MPC)优化来求解。我们引入一个工业 VM 打包问题的近似公式,将其表示为由预测参数化的带软约束的 MILP。近来,predict-and-optimize(PnO)被提出用于通过优化问题反向传播决策代价来端到端训练预测模型。但 PnO 无法扩展到云计算中普遍的大预测时域。为解决此问题,我们提出 Predict-and-Critic(PnC)框架,其仅用两步时域便通过利用强化学习优于 PnO。PnC 联合训练一个预测模型和一个近似长期代价-to-go 的终端 Q 函数,通过优化问题反向传播决策代价\emph{以及来自未来}。终端 Q 函数使我们能求解比 PnO 所需多步时域小得多的两步时域优化问题。我们在两个数据集、三种工作负载以及优化问题中未建模的扰动上评估 PnO 和 PnC 框架。我们发现 PnC 相较 PnO 显著改善决策质量,即使优化问题并非现实的完美表征。我们还发现,硬化 MILP 的软约束并穿过约束反向传播可改善 PnO 和 PnC 两者的决策质量。

关键词

引用

@article{arxiv.2212.01348,
  title  = {Predict-and-Critic: Accelerated End-to-End Predictive Control for Cloud Computing through Reinforcement Learning},
  author = {Kaustubh Sridhar and Vikramank Singh and Balakrishnan Narayanaswamy and Abishek Sankararaman},
  journal= {arXiv preprint arXiv:2212.01348},
  year   = {2023}
}