不安且不确定:通过深度多智能体强化学习求解 restless _bandit 的鲁棒策略
机器学习
2022-06-23 v2
摘要
我们在\textit{restless多臂bandit}(RMAB)中引入鲁棒性,RMAB是一种用于在独立随机过程(臂)间进行约束资源分配的流行模型。几乎所有RMAB技术都假设随机动态被精确已知。然而,在许多真实世界设定中,动态是通过历史数据等方式以显著\textem{不确定性}估计得到的,若被忽略可能导致糟糕结果。为此,我们开发了一种计算极小极大遗憾——RMAB的鲁棒策略——的算法。我们的方法使用双预言机框架(用于\textit{智能体}和\textit{自然}的预言机),该框架常用于单过程鲁棒规划,但需要重大的新技术以适配RMAB的组合性质。具体而言,我们设计了一个深度强化学习(RL)算法DDLPO,它通过在学习每个臂的策略网络的同时学习一个辅助“λ网络”来应对组合挑战,大幅降低样本复杂度,并具有收敛保证。DDLPO具有普遍意义,实现了我们的最大化奖励智能体预言机。随后我们通过将遗憾最大化自然预言机(一个非平稳RL挑战)表述为策略优化器与对抗性自然之间的多智能体RL问题,来解决这一艰巨挑战。该表述具有普遍意义——我们针对RMAB通过创建带有共享评论者的DDLPO多智能体扩展来求解它。我们展示了我们的方法在三个实验领域中表现良好。
引用
@article{arxiv.2107.01689,
title = {Restless and Uncertain: Robust Policies for Restless Bandits via Deep Multi-Agent Reinforcement Learning},
author = {Jackson A. Killian and Lily Xu and Arpita Biswas and Milind Tambe},
journal= {arXiv preprint arXiv:2107.01689},
year = {2022}
}
备注
16 pages, 4 figures