贝叶斯 Bandit 的连续时间极限
最优化与控制
2023-10-03 v3 机器学习
数值分析
数值分析
机器学习
摘要
本文重新审视贝叶斯设定下的 bandit 问题。贝叶斯方法将 bandit 问题表述为一个优化问题,目标是找到最小化贝叶斯遗憾的最优策略。贝叶斯方法面临的主要挑战之一是,最优策略的计算通常难以处理,尤其在问题时域长度或臂数较大时。本文中,我们首先证明在适当的重标度下,贝叶斯 bandit 问题收敛于一个连续的 Hamilton-Jacobi-Bellman(HJB)方程。对于若干常见 bandit 问题,极限 HJB 方程的最优策略可显式获得,而当无显式解时,我们给出求解 HJB 方程的数值方法。基于这些结果,我们提出了一种近似贝叶斯最优策略,用于求解大时域的贝叶斯 bandit 问题。我们的方法还有一个额外好处,即其计算成本不随时域增大而增加。
引用
@article{arxiv.2210.07513,
title = {Continuous-in-time Limit for Bayesian Bandits},
author = {Yuhua Zhu and Zachary Izzo and Lexing Ying},
journal= {arXiv preprint arXiv:2210.07513},
year = {2023}
}