中文

大规模局部智能体存在下的全局决策高效强化学习

机器学习 2024-10-24 v3 多智能体系统

摘要

我们研究了在存在局部智能体的情况下进行全局决策的强化学习,其中全局决策者做出影响所有局部智能体的决策,目标是学习一种策略以最大化所有智能体的联合奖励。此类问题有许多应用,例如需求响应、电动汽车充电、排队等。在此设定下,由于状态空间的大小可能随智能体数量呈指数增长,可扩展性一直是一个长期存在的挑战。本工作提出了 \texttt{SUBSAMPLE-Q} 算法,其中全局智能体对 knk\leq n 个局部智能体进行子采样,以在关于 kk 的多项式时间内计算策略。我们表明,随着子采样智能体数量 kk 的增加,该学习策略以 O~(1/k+ϵk,m)\tilde{O}(1/\sqrt{k}+{\epsilon}_{k,m}) 的阶数收敛到最优策略,其中 ϵk,m{\epsilon}_{k,m} 是贝尔曼噪声。最后,我们在需求响应设定和排队设定中通过数值模拟验证了该理论。

关键词

引用

@article{arxiv.2403.00222,
  title  = {Efficient Reinforcement Learning for Global Decision Making in the Presence of Local Agents at Scale},
  author = {Emile Anand and Guannan Qu},
  journal= {arXiv preprint arXiv:2403.00222},
  year   = {2024}
}

备注

34 pages, 6 figures