序贯蒙特卡洛老虎机
机器学习
2024-04-08 v4 机器学习
统计计算
摘要
我们通过使用序贯蒙特卡洛(SMC)方法,将贝叶斯多臂老虎机(MAB)算法扩展到其原始设定之外。MAB 是一个序贯决策问题,其目标是学习一个最大化长期收益的策畋,其中仅观察到所执行动作的奖励。在随机 MAB 中,每个动作的奖励由未知分布生成,通常假设为平稳的。为决定下一步采取哪个动作,MAB 智能体必须学习未知奖励分布的特征,例如计算其充分统计量。然而,除简单平稳情形外,这些统计量的闭式表达在分析上难以处理。我们在此利用 SMC 来估计贝叶斯 MAB 智能体所计算的统计量,并设计出可解决丰富一类老虎机问题的灵活策略:即具有非线性、无状态且依赖于上下文并随时间演化的奖励分布的 MAB。我们展示了涉及通过线性动力系统建模时间动态的非平稳老虎机,如何能由基于 SMC 的贝叶斯老虎机智能体成功处理。我们在若干先前难以解决(即具有非线性奖励的非平稳老虎机)的 MAB 场景中实证展示了所提基于 SMC 的老虎机策略的良好后悔性能。
引用
@article{arxiv.1808.02933,
title = {Sequential Monte Carlo Bandits},
author = {Iñigo Urteaga and Chris H. Wiggins},
journal= {arXiv preprint arXiv:1808.02933},
year = {2024}
}
备注
The software used for this study is publicly available at https://github.com/iurteaga/bandits