中文

上下文_bandit中的离屏风险评估

机器学习 2021-06-30 v2 机器学习

摘要

即使无法运行实验,从业者也可利用先前记录的数据评估预期策略。然而,尽管 bandits 文献已采用多种不同的目标,但迄今为止大多数关于离屏评估的研究聚焦于期望奖励。本文中,我们引入 Lipschitz 风险泛函,这是一类广泛的目标,包含条件风险价值(CVaR)、方差、均值-方差、许多扭曲风险以及 CPT 风险等。我们提出离屏风险评估(OPRA)框架,该框架首先估计目标策略的累积分布函数(CDF),然后对任意一组 Lipschitz 风险生成插件估计,提供在整个类别上同时成立的有限样本保证。我们以重要性采样和双重稳健估计器实例化 OPRA。我们的主要理论贡献是:(i) 上下文 bandit 中两种 CDF 估计器的首个一致集中不等式;(ii) 我们的 Lipschitz 风险估计的误差界,其均以 O(1/n)O(1/\sqrt{n}) 的速率收敛。

关键词

引用

@article{arxiv.2104.08977,
  title  = {Off-Policy Risk Assessment in Contextual Bandits},
  author = {Audrey Huang and Liu Leqi and Zachary C. Lipton and Kamyar Azizzadenesheli},
  journal= {arXiv preprint arXiv:2104.08977},
  year   = {2021}
}