中文

SPEED:用于异方差线性 Bandit 中策略评估的实验设计

机器学习 2024-03-04 v3 机器学习

摘要

本文研究线性 bandit 中用于策略评估的最优数据收集问题。在策略评估中,给定一个目标策略,要求估计其在多臂 bandit 环境中执行时期望获得的奖励。我们的工作是首个关注此类涉及异方差奖励噪声的线性 bandit 设定下策略评估最优数据收集策略的研究。我们首先在异方差线性 bandit 设定下提出了一种用于加权最小二乘估计的最优设计,以降低目标策略价值的均方误差(MSE)。我们利用该公式推导了数据收集过程中每个动作的最优样本分配方案。随后我们引入了一种新颖算法 SPEED(Structured Policy Evaluation Experimental Design,结构化策略评估实验设计),该算法跟踪最优设计并推导了其相对于最优设计的后悔值。最后,我们通过实证验证,SPEED 实现的策略评估均方误差与预言机策略相当,且显著低于直接运行目标策略。

关键词

引用

@article{arxiv.2301.12357,
  title  = {SPEED: Experimental Design for Policy Evaluation in Linear Heteroscedastic Bandits},
  author = {Subhojyoti Mukherjee and Qiaomin Xie and Josiah Hanna and Robert Nowak},
  journal= {arXiv preprint arXiv:2301.12357},
  year   = {2024}
}