中文

面向受损多臂老虎机的高效最优策略梯度算法

机器学习 2025-02-21 v1

摘要

本文考虑了带有对抗性损坏的随机多臂老虎机问题,其中机械臂的随机奖励部分被对手修改以欺骗算法。我们将策略梯度算法 SAMBA 应用于该设置,并指出其计算高效,且实现了一种状态的最优 O(KlogT/Δ)+O(C/Δ)O(K\log T/\Delta) + O(C/\Delta) 累积懊惩上界,其中 KK 为机械臂数量,CC 为未知损坏程度,Δ\Delta 为最佳机械臂与其他机械臂之间最小预期奖励间隔,TT 为时间范围。与现有最佳高效算法(例如 CBARBAR)其累积懊惩上界为 O(Klog2T/Δ)+O(C)O(K\log^2 T/\Delta) + O(C) 相比,我们表明 SAMBA 在懊惩上界中减少了一个 logT\log T 因子,同时保持损坏相关项与 CC 成线性。这在渐近意义上是最优的。我们还进行了仿真实验以演示 SAMBA 的有效性,结果表明 SAMBA 在已有基准方法之上。

关键词

引用

@article{arxiv.2502.14146,
  title  = {Efficient and Optimal Policy Gradient Algorithm for Corrupted Multi-armed Bandits},
  author = {Jiayuan Liu and Siwei Wang and Zhixuan Fang},
  journal= {arXiv preprint arXiv:2502.14146},
  year   = {2025}
}