中文

多臂_bandit 的极小极大离策略评估

机器学习 2021-01-20 v1 机器学习 统计理论 统计理论

摘要

我们研究具有有界奖励的多臂 bandit 模型中的离策略评估问题,并在三种设定下发展极小极大速率最优过程。第一,当行为策略已知时,我们证明 Switch 估计量(一种在插件与重要性采样估计量间交替的方法)对所有样本量均为极小极大速率最优。第二,当行为策略未知时,我们从竞争比角度分析性能,从而揭示已知与未知行为策略设定之间的根本差距。当行为策略未知时,任何估计量的均方误差——相对于配备行为策略知识的预言估计量——都必须以一个正比于目标策略支撑大小的乘法因子而更大。此外,我们证明插件方法在该最坏情形竞争比上至多相差对数因子。第三,我们开创性地研究部分知识设定,即假设行为策略所取最小概率已知。我们证明插件估计量在最小概率相对较大时最优,但在最小概率较低时次优。为弥补此缺口,我们提出一种基于 Chebyshev 多项式逼近的新估计量,可证明达到最优估计误差。在模拟与真实数据上的数值实验证实了我们的理论发现。

关键词

引用

@article{arxiv.2101.07781,
  title  = {Minimax Off-Policy Evaluation for Multi-Armed Bandits},
  author = {Cong Ma and Banghua Zhu and Jiantao Jiao and Martin J. Wainwright},
  journal= {arXiv preprint arXiv:2101.07781},
  year   = {2021}
}