中文

具有对数通信代价的 Langevin Thompson 采样:赌博机与强化学习

机器学习 2023-06-16 v1 人工智能 机器学习

摘要

Thompson 采样(TS)因其易用性与良好的经验性能而广泛用于序贯决策。然而,许多现有的 TS 分析与经验结果依赖于对奖励分布的限制性假设,例如属于共轭族,这限制了其在现实场景中的适用性。此外,序贯决策问题常以批量方式执行,或因问题固有性质,或出于降低通信与计算成本之目的。本文在两个流行设定中联合研究这些问题,即随机多臂赌博机(MABs)与无限 horizon 强化学习(RL),其中 TS 分别用于学习未知奖励分布与转移动态。我们提出批量 Langevin Thompson 采样\textit{Langevin Thompson 采样} 算法,利用 MCMC 方法从近似后验中采样,其通信代价仅关于批次数呈对数级。我们的算法计算高效,并保持随机 MABs 的 O(logT)\mathcal{O}(\log T) 与 RL 的 O(T)\mathcal{O}(\sqrt{T}) 同阶最优后悔保证。我们以实验结果补充理论发现。

关键词

引用

@article{arxiv.2306.08803,
  title  = {Langevin Thompson Sampling with Logarithmic Communication: Bandits and Reinforcement Learning},
  author = {Amin Karbasi and Nikki Lijing Kuang and Yi-An Ma and Siddharth Mitra},
  journal= {arXiv preprint arXiv:2306.08803},
  year   = {2023}
}

备注

ICML 2023