未知转移与强盗反馈下对抗性 restless 多臂赌博机的高效强化学习
机器学习
2024-05-03 v1 人工智能
机器学习
摘要
Restless 多臂赌博机 (RMAB) 在建模序贯决策问题中起着核心作用,该问题受瞬时激活约束限制,即在任意决策时刻最多只能激活 B 个臂。每个 restless 臂被赋予一个状态,该状态根据马尔可夫决策过程独立演化,而无论其是否被激活。在本文中,我们考虑在具有未知转移函数和对抗性奖励的情景式 RMAB 中的学习任务,其中对抗性奖励可以在不同情景间任意变化。此外,我们考虑了一个具有挑战性但自然的强盗反馈设置,即决策者 (DM) 仅能观察到被激活臂的对抗性奖励。DM 的目标是在学习过程中最大化其总对抗性奖励,同时必须在每个决策时刻满足瞬时激活约束。我们开发了一种新颖的强化学习算法,其包含两个关键贡献:一种新颖的有偏对抗性奖励估计器,用于处理强盗反馈和未知转移;以及一种低复杂度的索引策略,用于满足瞬时激活约束。我们证明了我们的算法具有 的遗憾界,其中 是情景数, 是情景长度。据我们所知,这是第一个在我们所考虑的具有挑战性的设置中,为对抗性 RMAB 保证 遗憾界的算法。
引用
@article{arxiv.2405.00950,
title = {Provably Efficient Reinforcement Learning for Adversarial Restless Multi-Armed Bandits with Unknown Transitions and Bandit Feedback},
author = {Guojun Xiong and Jian Li},
journal= {arXiv preprint arXiv:2405.00950},
year = {2024}
}
备注
Accepted by ICML 2024