中文

实验中的马尔可夫干扰

机器学习 2022-06-10 v2 计量经济学 机器学习

摘要

我们考虑动态系统中的实验,其中对某些实验单元的干预通过一种限制性约束(如有限库存)影响其他单元。尽管具有极大的实际重要性,针对这一“马尔可夫”干扰问题的最佳估计量在很大程度上是启发式的,其偏差尚未被充分理解。我们将此类实验中的推断问题形式化为策略评估问题。离屏策略估计量虽无偏,但相对于最先进的启发式方法显然在方差上付出了巨大代价。我们提出一种在屏策略估计量:Q值之差(DQ)估计量。我们证明 DQ 估计量在一般情况下可比重离屏策略评估具有指数级更小的方差。同时,其偏差在干预影响上为二阶。这产生了显著的偏差-方差权衡,使得 DQ 估计量有效主导了最先进的替代方法。从理论角度看,我们引入了三种独立新颖的技术,在强化学习(RL)理论中具有独立意义。我们的实证评估包括在城市规模的网约车模拟器上的一组实验。

关键词

引用

@article{arxiv.2206.02371,
  title  = {Markovian Interference in Experiments},
  author = {Vivek F. Farias and Andrew A. Li and Tianyi Peng and Andrew Zheng},
  journal= {arXiv preprint arXiv:2206.02371},
  year   = {2022}
}