面向受损多臂老虎机的高效最优策略梯度算法
机器学习
2025-02-21 v1
摘要
本文考虑了带有对抗性损坏的随机多臂老虎机问题,其中机械臂的随机奖励部分被对手修改以欺骗算法。我们将策略梯度算法 SAMBA 应用于该设置,并指出其计算高效,且实现了一种状态的最优 累积懊惩上界,其中 为机械臂数量, 为未知损坏程度, 为最佳机械臂与其他机械臂之间最小预期奖励间隔, 为时间范围。与现有最佳高效算法(例如 CBARBAR)其累积懊惩上界为 相比,我们表明 SAMBA 在懊惩上界中减少了一个 因子,同时保持损坏相关项与 成线性。这在渐近意义上是最优的。我们还进行了仿真实验以演示 SAMBA 的有效性,结果表明 SAMBA 在已有基准方法之上。
引用
@article{arxiv.2502.14146,
title = {Efficient and Optimal Policy Gradient Algorithm for Corrupted Multi-armed Bandits},
author = {Jiayuan Liu and Siwei Wang and Zhixuan Fang},
journal= {arXiv preprint arXiv:2502.14146},
year = {2025}
}