具有对数通信代价的 Langevin Thompson 采样:赌博机与强化学习
机器学习
2023-06-16 v1 人工智能
机器学习
摘要
Thompson 采样(TS)因其易用性与良好的经验性能而广泛用于序贯决策。然而,许多现有的 TS 分析与经验结果依赖于对奖励分布的限制性假设,例如属于共轭族,这限制了其在现实场景中的适用性。此外,序贯决策问题常以批量方式执行,或因问题固有性质,或出于降低通信与计算成本之目的。本文在两个流行设定中联合研究这些问题,即随机多臂赌博机(MABs)与无限 horizon 强化学习(RL),其中 TS 分别用于学习未知奖励分布与转移动态。我们提出批量 算法,利用 MCMC 方法从近似后验中采样,其通信代价仅关于批次数呈对数级。我们的算法计算高效,并保持随机 MABs 的 与 RL 的 同阶最优后悔保证。我们以实验结果补充理论发现。
引用
@article{arxiv.2306.08803,
title = {Langevin Thompson Sampling with Logarithmic Communication: Bandits and Reinforcement Learning},
author = {Amin Karbasi and Nikki Lijing Kuang and Yi-An Ma and Siddharth Mitra},
journal= {arXiv preprint arXiv:2306.08803},
year = {2023}
}
备注
ICML 2023