Restless多臂赌博机中的全局奖励
机器学习
2024-06-11 v2 人工智能
计算机与社会
摘要
Restless多臂赌博机(RMAB)扩展了多臂赌博机,使得拉动一个臂会影响未来状态。尽管RMAB取得了成功,但一个关键的局限性假设是奖励可分解为各臂之和。我们通过提出具有全局奖励的restless多臂赌博机(RMAB-G)来解决这一缺陷,这是RMAB对全局非可分离奖励的推广。为了求解RMAB-G,我们开发了线性Whittle指数和Shapley-Whittle指数,将Whittle指数从RMAB扩展到RMAB-G。我们证明了近似界,但也指出了当奖励函数高度非线性时这些指数可能失效的情况。为了克服这一点,我们提出了两组自适应策略:第一组迭代计算指数,第二组将指数与蒙特卡洛树搜索(MCTS)相结合。通过实验,我们使用合成数据和来自食物救援的真实数据证明了我们提出的策略优于基线和基于指数的策略。
引用
@article{arxiv.2406.00738,
title = {Global Rewards in Restless Multi-Armed Bandits},
author = {Naveen Raman and Zheyuan Ryan Shi and Fei Fang},
journal= {arXiv preprint arXiv:2406.00738},
year = {2024}
}
备注
27 pages