在线决策的统计推断:在上下文老虎机设定下
机器学习
2020-10-15 v1 机器学习
摘要
在线决策问题要求我们基于增量信息做出一系列决策。常见的解决方案通常需要学习给定上下文信息下不同动作的奖励模型,然后最大化长期奖励。了解所设定的模型是否合理以及该模型在渐近意义下的表现是有意义的。我们在具有线性奖励模型的上下文老虎机框架下研究此问题。采用 -贪婪策略来解决经典的探索-利用困境。利用鞅中心极限定理,我们证明模型参数的在线普通最小二乘估计量是渐近正态的。当线性模型设定错误时,我们提出使用逆倾向得分加权的在线加权最小二乘估计量,并同样建立其渐近正态性。基于参数估计量的性质,我们进一步证明样本内逆倾向加权价值估计量是渐近正态的。我们使用模拟以及来自 Yahoo! 的新闻文章推荐数据集的应用来说明我们的结果。
引用
@article{arxiv.2010.07283,
title = {Statistical Inference for Online Decision-Making: In a Contextual Bandit Setting},
author = {Haoyu Chen and Wenbin Lu and Rui Song},
journal= {arXiv preprint arXiv:2010.07283},
year = {2020}
}
备注
Accepted by the Journal of the American Statistical Association