中文

政策选择与最优臂辨识:探索性抽样的渐近分析

计量经济学 2021-11-25 v5 机器学习 统计方法学

摘要

我们考虑由Kasy和Sautmann(2021)针对自适应实验设计提出的“政策选择”问题——在赌博机文献中亦称为最优臂辨识。Kasy和Sautmann(2021)的定理1给出了三个渐近结果,为针对该设定开发的探索性抽样提供了理论保证。我们首先指出定理1(1)的证明存在技术性问题,且定理1(2)的证明与陈述均不正确。随后通过一个反例表明定理1(3)不成立。对于前两者,我们修正了陈述并给出了严格证明。对于定理1(3),我们提出了一个替代目标函数,称之为后验加权政策后悔,并推导了探索性抽样的渐近最优性。

关键词

引用

@article{arxiv.2109.08229,
  title  = {Policy Choice and Best Arm Identification: Asymptotic Analysis of Exploration Sampling},
  author = {Kaito Ariu and Masahiro Kato and Junpei Komiyama and Kenichiro McAlinn and Chao Qin},
  journal= {arXiv preprint arXiv:2109.08229},
  year   = {2021}
}

备注

Submitted to Econometrica