利用自助法对在线学习样本去偏
机器学习
2021-12-02 v2 统计理论
统计理论
摘要
文献中最近表明,当用于估计平均收益时,在线学习实验的样本均值是带偏的。为纠正偏差,离策略评估方法(包括重要性采样和双重稳健估计量)通常计算条件倾向得分,而对于UCB等非随机化策略该得分是未定义的。本文提供一种利用自助法对样本去偏的步骤,其不需要收益分布的知识且可应用于任意自适应策略。数值实验展示了针对Explore-Then-Commit(ETC)、UCB、Thompson sampling(TS)和-greedy(EG)等流行多臂老虎机算法生成样本的有效偏差削减。我们在ETC算法下对该步骤进行分析并给出理论依据,包括真实与自助世界中偏差衰减率的渐近收敛性。
引用
@article{arxiv.2108.00236,
title = {Debiasing Samples from Online Learning Using Bootstrap},
author = {Ningyuan Chen and Xuefeng Gao and Yi Xiong},
journal= {arXiv preprint arXiv:2108.00236},
year = {2021}
}