大规模局部智能体存在下的全局决策高效强化学习
机器学习
2024-10-24 v3 多智能体系统
摘要
我们研究了在存在局部智能体的情况下进行全局决策的强化学习,其中全局决策者做出影响所有局部智能体的决策,目标是学习一种策略以最大化所有智能体的联合奖励。此类问题有许多应用,例如需求响应、电动汽车充电、排队等。在此设定下,由于状态空间的大小可能随智能体数量呈指数增长,可扩展性一直是一个长期存在的挑战。本工作提出了 \texttt{SUBSAMPLE-Q} 算法,其中全局智能体对 个局部智能体进行子采样,以在关于 的多项式时间内计算策略。我们表明,随着子采样智能体数量 的增加,该学习策略以 的阶数收敛到最优策略,其中 是贝尔曼噪声。最后,我们在需求响应设定和排队设定中通过数值模拟验证了该理论。
引用
@article{arxiv.2403.00222,
title = {Efficient Reinforcement Learning for Global Decision Making in the Presence of Local Agents at Scale},
author = {Emile Anand and Guannan Qu},
journal= {arXiv preprint arXiv:2403.00222},
year = {2024}
}
备注
34 pages, 6 figures