中文

自适应实验中用于策略评估的自适应双重稳健估计量及关于日志策略的一个悖论

机器学习 2021-06-22 v5 计量经济学 统计方法学 机器学习

摘要

双重稳健(DR)估计量由两个干扰参数——条件均值结果和日志策略(选择动作的概率)——组成,在因果推断中至关重要。本文提出一种针对自适应实验所得相关样本的 DR 估计量。为从具有非 Donsker 干扰估计量的相关样本获得渐近正态半参数估计量,我们提出自适应拟合作为样本分割的一种变体。我们还报告了一个经验悖论:我们提出的 DR 估计量相较于其他利用真实日志策略的估计量往往表现更优。尽管在独立同分布样本上的估计量已知有类似现象,但基于渐近效率的传统解释无法阐明我们这种相关样本的情形。我们通过模拟研究证实了该假设。

关键词

引用

@article{arxiv.2010.03792,
  title  = {The Adaptive Doubly Robust Estimator for Policy Evaluation in Adaptive Experiments and a Paradox Concerning Logging Policy},
  author = {Masahiro Kato and Shota Yasui and Kenichiro McAlinn},
  journal= {arXiv preprint arXiv:2010.03792},
  year   = {2021}
}