中文

基于自适应收集数据的离策略估计:在线学习的力量

机器学习 2024-11-21 v1 机器学习 最优化与控制 统计理论 统计理论

摘要

我们考虑使用自适应收集的数据来估计处理效应的线性泛函。该任务有诸多应用,包括上下文赌博机中的离策略评估(\textsf{OPE})和因果推断中的平均处理效应(\textsf{ATE})估计。虽然某一类增强逆倾向加权(\textsf{AIPW})估计量具有理想的渐近性质,包括半参数有效性,但关于它们在自适应收集数据下的非渐近理论却知之甚少。为了填补这一空白,我们首先建立了AIPW估计量类的均方误差的通用上界,该上界关键性地依赖于处理效应及其估计值之间的序列加权误差。受此启发,我们还提出了一种通用归约方案,允许通过在线学习产生一系列处理效应估计值,以最小化序列加权估计误差。为了说明这一点,我们在(\romannumeral 1)表格情况;(\romannumeral 2)线性函数近似情况;以及(\romannumeral 3)结果模型的一般函数近似情况中提供了三个具体实例。然后,我们提供了一个局部极小化极大下界,以证明使用无悔在线学习算法的\textsf{AIPW}估计量的实例依赖最优性。

关键词

引用

@article{arxiv.2411.12786,
  title  = {Off-policy estimation with adaptively collected data: the power of online learning},
  author = {Jeonghwan Lee and Cong Ma},
  journal= {arXiv preprint arXiv:2411.12786},
  year   = {2024}
}

备注

37 pages. Accepted to the 38th Annual Conference on Neural Information Processing Systems (NeurIPS 2024), Vancouver, British Columbia, Canada