提升信息比:上下文老虎机中Thompson采样的信息论分析
机器学习
2023-03-07 v2
摘要
我们研究了著名Thompson采样算法在具有二元损失和对手选择上下文的上下文老虎机中的贝叶斯遗憾。我们将\cite{RvR16}的信息论视角适配到上下文设定,考虑以未知模型参数定义的信息比的提升版本,而非如先前同一设定下工作所做的那样以最优动作或最优策略定义。这使我们能够通过极其简单的证明,并以对似然或先验无结构假设的方式,根据先验分布的熵来界定遗憾。到具有无限熵先验的推广仅需对对数似然作Lipschitz假设。一个有趣的特殊情形是具有维参数、个动作和Lipschitz logits的逻辑老虎机,我们对其给出了不依赖于sigmoid链接函数最小斜率的遗憾上界。
引用
@article{arxiv.2205.13924,
title = {Lifting the Information Ratio: An Information-Theoretic Analysis of Thompson Sampling for Contextual Bandits},
author = {Gergely Neu and Julia Olkhovskaya and Matteo Papini and Ludovic Schwartz},
journal= {arXiv preprint arXiv:2205.13924},
year = {2023}
}