中文

面向预算受限的多主体 MDP 容量感知规划与调度:一种元强化学习方法

机器学习 2025-10-08 v2 人工智能

摘要

我们研究了容量和预算受限的多主体 MDP (CB-MA-MDP),该类问题可刻画许多维护与调度任务,其中每个主体都可能不可逆地失效,而规划者必须决定 (1) 何时应用恢复动作,以及 (2) 同时处理哪些主体子集。全局预算限制恢复动作的总数,而容量约束限制同时执行动作的数量,使得朴素的动态规划方法演变为随主体数量指数级增长的组合搜索问题。我们提出了两种可扩展的解决方案:第一阶段,基于线性和assignment 问题 (LSAP) 的分组将主体划分为 r 不相交子集 (r = 容量),以最大化期望故障时间至的多样性,将预算按比例分配给每个子集。第二阶段,一个元训练的 PPO 策略解决每个子 MDP,利用跨子集的迁移学习加速收敛。为验证我们的方法, 我们将其应用于大型工业机器人维修调度问题,该问题受限于维修技术员数量有限以及总维修预算有限。我们的实验结果表明,所提方法在提升机器人团队平均在岗时间方面优于基线方法,尤其在大型团队规模下效果更为显著。最后,我们通过在不同机器人数量和维修技术员数量下的计算复杂度分析确认了该方法的可扩展性。

关键词

引用

@article{arxiv.2410.21249,
  title  = {Capacity-Aware Planning and Scheduling in Budget-Constrained Multi-Agent MDPs: A Meta-RL Approach},
  author = {Manav Vora and Ilan Shomorony and Melkior Ornik},
  journal= {arXiv preprint arXiv:2410.21249},
  year   = {2025}
}