中文

关于线性 Thompson 采样的频率主义后悔界

机器学习 2023-04-24 v3 机器学习

摘要

本文研究随机线性_bandit 问题,其中决策者从 Rd\mathbb{R}^d 中可能为时变向量集中选择动作并接收带噪奖励。目标是在 TT 次决策序列上最小化后悔值,即决策者的累积期望奖励与知晓各动作期望奖励的预言机之间的差值。线性 Thompson 采样 (LinTS) 是一种流行的贝叶斯启发式方法,理论分析表明其贝叶斯后悔以 O~(dT)\widetilde{\mathcal{O}}(d\sqrt{T}) 为界,与极小极大下界匹配。然而,先前研究表明 LinTS 的频率主义后悔界为 O~(ddT)\widetilde{\mathcal{O}}(d\sqrt{dT}),这需要后验方差膨胀,且比最优的基于乐观主义的算法差 d\sqrt{d} 因子。我们证明了这种膨胀是根本性的,且 O~(ddT)\widetilde{\mathcal{O}}(d\sqrt{dT}) 的频率主义界是最佳可能的,通过展示 LinTS 中在不膨胀时会导致线性后悔的随机化偏差现象。我们提出了一种数据驱动的 LinTS 版本,利用观测数据调整后验膨胀,在附加条件下可实现极小极大最优的频率主义后悔。我们的分析为 LinTS 提供了新见解并解决了一个该领域的开放问题。

关键词

引用

@article{arxiv.2006.06790,
  title  = {On Frequentist Regret of Linear Thompson Sampling},
  author = {Nima Hamidi and Mohsen Bayati},
  journal= {arXiv preprint arXiv:2006.06790},
  year   = {2023}
}