上下文_bandit中的离屏风险评估
机器学习
2021-06-30 v2 机器学习
摘要
即使无法运行实验,从业者也可利用先前记录的数据评估预期策略。然而,尽管 bandits 文献已采用多种不同的目标,但迄今为止大多数关于离屏评估的研究聚焦于期望奖励。本文中,我们引入 Lipschitz 风险泛函,这是一类广泛的目标,包含条件风险价值(CVaR)、方差、均值-方差、许多扭曲风险以及 CPT 风险等。我们提出离屏风险评估(OPRA)框架,该框架首先估计目标策略的累积分布函数(CDF),然后对任意一组 Lipschitz 风险生成插件估计,提供在整个类别上同时成立的有限样本保证。我们以重要性采样和双重稳健估计器实例化 OPRA。我们的主要理论贡献是:(i) 上下文 bandit 中两种 CDF 估计器的首个一致集中不等式;(ii) 我们的 Lipschitz 风险估计的误差界,其均以 的速率收敛。
引用
@article{arxiv.2104.08977,
title = {Off-Policy Risk Assessment in Contextual Bandits},
author = {Audrey Huang and Liu Leqi and Zachary C. Lipton and Kamyar Azizzadenesheli},
journal= {arXiv preprint arXiv:2104.08977},
year = {2021}
}