平均概率收敛下非平稳日志记录策略的自适应双重稳健估计量
统计方法学
2021-03-24 v2 机器学习
计量经济学
摘要
自适应实验,包括高效平均处理效应估计和多臂老虎机算法,已在各种应用中受到关注,例如社会实验、临床试验和在线广告优化。本文考虑从自适应实验中获得的样本估计某个动作的平均结果。在因果推断中,动作的平均结果起着关键作用,且该估计是一项基本任务,其中平均处理效应估计和离屏价值估计是其变体。在自适应实验中,选择动作的概率(日志记录策略)允许基于过去观测顺序更新。由于该日志记录策略依赖于过去观测,样本通常并非独立同分布(i.i.d.),使得开发渐近正态估计量困难。针对此问题的典型方法是假设日志记录策略收敛于一个时不变函数。然而,该假设在各种应用中具有限制性,例如当日志记录策略波动或在某些时段变为零时。为缓解此限制,我们提出另一假设,即平均日志记录策略收敛于时不变函数,并展示了双重稳健(DR)估计量的渐近正态性。在该假设下,日志记录策略本身可对某些动作波动或为零。我们还通过模拟展示了经验性质。
引用
@article{arxiv.2102.08975,
title = {Adaptive Doubly Robust Estimator from Non-stationary Logging Policy under a Convergence of Average Probability},
author = {Masahiro Kato},
journal= {arXiv preprint arXiv:2102.08975},
year = {2021}
}