中文

在线学习中最优策略评估的双重稳健区间估计

机器学习 2024-08-05 v4 机器学习 统计理论 统计方法学 统计理论

摘要

评估进行中策略的性能在医学和经济学等诸多领域起着至关重要的作用,为在线实验的提前停止和来自环境的及时反馈提供关键指导。因此,在线学习中的策略评估通过实时推断最优策略的平均结果(即价值)而受到越来越多的关注。然而,由于在线环境中生成的依赖数据、未知的最优策略以及自适应实验中复杂的探索与利用权衡,该问题尤其具挑战性。在本文中,我们旨在克服在线学习策略评估中的这些困难。我们显式推导了探索概率,该概率量化了在常用bandit算法下探索非最优动作的概率。我们利用该概率对每种动作下的在线条件均值估计量进行有效性推断,并发展双重稳健区间估计(DREAM)方法以推断在线学习中估计最优策略下的价值。所提价值估计量对一致性提供双重保护,且渐近正态并给出Wald型置信区间。我们进行了广泛的模拟研究和真实数据应用以证明所提DREAM方法的经验有效性。

关键词

引用

@article{arxiv.2110.15501,
  title  = {Doubly Robust Interval Estimation for Optimal Policy Evaluation in Online Learning},
  author = {Ye Shen and Hengrui Cai and Rui Song},
  journal= {arXiv preprint arXiv:2110.15501},
  year   = {2024}
}