中文

用于上下文老虎机与强化学习的Feel-Good Thompson采样

机器学习 2021-10-05 v1 统计理论 机器学习 统计理论

摘要

Thompson采样因其建模能力的灵活性而被广泛用于上下文老虎机问题。然而,这类方法在频率派设定下的通用理论仍然缺乏。本文中,我们给出Thompson采样的理论分析,聚焦于频率派后悔界。在此设定下,我们表明标准Thompson采样在探索新动作上不够主动,导致在某些悲观情形下次优。我们提出一种称为Feel-Good Thompson采样的简单修正,其比标准Thompson采样更主动地偏好高奖励模型,以补救该问题。我们展示该理论框架可用于推导标准Thompson采样的贝叶斯后悔界,以及Feel-Good Thompson采样的频率派后悔界。结果表明,在两种情形下,我们均可将老虎机后悔问题归约为在线最小二乘回归估计。对于频率派分析,在线最小二乘回归界可直接使用已被充分研究的在线聚合技术获得。所得老虎机后悔界在有限动作情形下与极小极大下界匹配。此外,该分析可推广至处理一类线性可嵌入的上下文老虎机问题(其推广了流行的线性上下文老虎机模型)。所得结果再次与极小极大下界匹配。最后我们说明该分析可扩展至处理某些MDP问题。

关键词

引用

@article{arxiv.2110.00871,
  title  = {Feel-Good Thompson Sampling for Contextual Bandits and Reinforcement Learning},
  author = {Tong Zhang},
  journal= {arXiv preprint arXiv:2110.00871},
  year   = {2021}
}