处理情境性多臂赌博机中潜在状态动力学的直接方法
机器学习
2026-04-10 v1 机器学习
摘要
我们重新审视Nelson等人(2022)提出的有限臂线性多臂赌博机模型,其中情境和奖励由有限隐藏马尔可夫链支配。Nelson等人(2022)通过将问题归约为线性情境多臂赌博机来处理该模型;但他们实际上引入了一种简化,即奖励是给定观察情境后隐藏状态后验概率的线性函数,而非隐藏状态本身的函数。他们的分析(但非算法)也未考虑隐藏马尔可夫链参数的估计,仅处理期望值而非高概率保证,而且这些保证还因不必要的模型依赖(如奖励间隙)而显得复杂。我们则研究更自然的模型,纳入隐藏状态上的直接依赖(在自然的情境依赖基础上),并为一种全自适应策略(在线估计隐藏马尔可夫链参数)获得更强的高概率 regret界限。这些界限不依赖奖励函数,仅通过隐藏马尔可夫链参数的估计来依赖模型。
引用
@article{arxiv.2604.08149,
title = {A Direct Approach for Handling Contextual Bandits with Latent State Dynamics},
author = {Zhen Li and Gilles Stoltz},
journal= {arXiv preprint arXiv:2604.08149},
year = {2026}
}