中文

带切换成本和跨层约束的双层在线资源配置与调度

机器学习 2026-02-24 v2

摘要

我们研究了一个受网络资源分配启发的双层在线资源配置与调度问题,其中资源配置决策在慢时间尺度上做出,而队列或状态相关的调度在快时间尺度上执行。我们使用上层的在线凸优化(OCO)问题和下层的受约束马尔可夫决策过程(CMDP)来建模这种双时间尺度的相互作用。现有的 OCO 通常假设无状态决策,因而无法捕捉队列演化等 MDP 网络动力学;而 CMDP 算法通常假设固定的约束阈值,而在资源配置-调度系统中,阈值会随在线预算决策的变化而变化。为解决这些差距,我们研究在切换成本(预算重新配置/系统重新配置)和跨层约束(将预算耦合到调度决策)下的双层 OCO-CMDP 学习。我们的新算法通过几个非平凡的开发来解决这一学习问题,包括精心设计的对偶反馈,该反馈将预算乘子作为上层更新的灵敏度信息,并在下层通过扩展的占有率测度线性规划求解预算自适应安全探索问题。我们建立了近最优的 regret 上界以及跨层约束的高概率满足。

关键词

引用

@article{arxiv.2601.18936,
  title  = {Bi-Level Online Provisioning and Scheduling with Switching Costs and Cross-Level Constraints},
  author = {Jialei Liu and C. Emre Koksal and Ming Shi},
  journal= {arXiv preprint arXiv:2601.18936},
  year   = {2026}
}