中文

利用自助法对在线学习样本去偏

机器学习 2021-12-02 v2 统计理论 统计理论

摘要

文献中最近表明,当用于估计平均收益时,在线学习实验的样本均值是带偏的。为纠正偏差,离策略评估方法(包括重要性采样和双重稳健估计量)通常计算条件倾向得分,而对于UCB等非随机化策略该得分是未定义的。本文提供一种利用自助法对样本去偏的步骤,其不需要收益分布的知识且可应用于任意自适应策略。数值实验展示了针对Explore-Then-Commit(ETC)、UCB、Thompson sampling(TS)和ϵ\epsilon-greedy(EG)等流行多臂老虎机算法生成样本的有效偏差削减。我们在ETC算法下对该步骤进行分析并给出理论依据,包括真实与自助世界中偏差衰减率的渐近收敛性。

关键词

引用

@article{arxiv.2108.00236,
  title  = {Debiasing Samples from Online Learning Using Bootstrap},
  author = {Ningyuan Chen and Xuefeng Gao and Yi Xiong},
  journal= {arXiv preprint arXiv:2108.00236},
  year   = {2021}
}