Bandit Whisperer:非平稳赌博机的通信学习
机器学习
2025-03-20 v3 多智能体系统
摘要
将强化学习(RL)应用于非平稳多臂赌博机(RMABs)为解决具有资源约束和时间动态的分配问题提供了有前景的途径。然而,经典的RMAB模型在很大程度上忽略了系统性数据误差的挑战——这是现实场景中由于数据收集协议差异和差分隐私的主动噪声等因素而常见的情况。我们证明,用于训练RMABs的传统RL算法在这样的设定下可能难以表现良好。为了解决这个问题,我们提出了RMABs中首个通信学习方法,研究了哪些臂在参与通信时最能有效缓解此类系统性数据误差的影响。在我们的设定中,臂从相似臂接收Q函数参数作为消息来指导行为策略,引导Q函数的更新。我们通过考虑所有臂对的联合效用并使用分解联合效用的Q网络架构来学习通信策略。理论和实证证据均验证了我们方法在多样化问题中显著提升RMAB性能的有效性。
引用
@article{arxiv.2408.05686,
title = {The Bandit Whisperer: Communication Learning for Restless Bandits},
author = {Yunfan Zhao and Tonghan Wang and Dheeraj Nagaraj and Aparna Taneja and Milind Tambe},
journal= {arXiv preprint arXiv:2408.05686},
year = {2025}
}