中文

深度强化学习何时会战胜已校准基准?面向自适应资源控制的基准研究

机器学习 2026-05-27 v1 人工智能 分布式、并行与集群计算

摘要

一个经过proper校准的基于规则的自增器,在我们测试的每一种主流深度强化学习(DRL)算法中都可以在成本上取得优势——那么,DRL究竟在何时、是否真正有用?我们在 RLScale-Bench 中进行研究,这是一个针对自适应资源控制中 DRL 的可复现基准和评估协议。在该基准中,智能体需在成本和服务水平约束下分配计算资源以应对动态工作负载。我们在匹配的架构、训练预算和奖励函数下,对 PPO、DQN、A2C、SAC、TD3 和 DDPG进行评估,并对照经过校准的基于规则基准进行比较,测试六种工作负载模式和五个随机种子(共240次实验),在 Kubernetes 水平pod自动扩展上实例化该基准,并探讨分布迁移的泛化性。三个发现挑战了常见假设:(i) 校准的控制器在所有六种工作负载中都实现最低成本,尽管在突发和闪流流量中尾随于最佳 RL 智能体;(ii) 离散动作算法因动作空间不匹配,在约束违规方面优于连续动作算法一个数量级甚至两个数量级;(iii) 没有单一算法在所有工作负载中均占据统治地位,排名在不同工作负载间可偏移最多四个位置。在 RL 基于资源控制的瓶颈不在于算法选择,而在于基准校准、奖励工程以及现实主义评估协议。

关键词

引用

@article{arxiv.2605.26418,
  title  = {When Does Deep RL Beat Calibrated Baselines? A Benchmark Study on Adaptive Resource Control},
  author = {Guilin Zhang and Chuanyi Sun and Kai Zhao and Shahryar Sarkani and John Fossaceca},
  journal= {arXiv preprint arXiv:2605.26418},
  year   = {2026}
}