中文

基于草图绘制的上下文批量_bandit奖励填补

机器学习 2023-10-10 v3 人工智能

摘要

上下文批量_bandit(CBB)是一种在每个回合结束时从环境观测到一批奖励的设定,但未执行动作的奖励未被观测到,导致部分信息反馈。现有的 CBB 方法常忽略未执行动作的奖励,造成反馈信息利用不足。本文提出一种称为带填补奖励的草图策略更新(SPUIR)的高效方法,利用草图绘制补全未观测奖励,从而近似全信息反馈。我们将奖励填补表述为一个捕捉已执行与未执行动作反馈机制的填补正则化岭回归问题。为降低时间复杂度,我们使用随机草图绘制求解该回归问题。我们证明该方法取得的瞬时后悔具有可控偏差且方差小于无奖励填补的方法。此外,该方法相对最优策略享有次线性后悔界。我们还给出两种扩展:速率调度版本与非线性奖励版本,使方法更实用。实验结果表明,SPUIR 在合成、公共基准及真实世界数据集上均优于最先进的基线。

关键词

引用

@article{arxiv.2210.06719,
  title  = {Reward Imputation with Sketching for Contextual Batched Bandits},
  author = {Xiao Zhang and Ninglu Shao and Zihua Si and Jun Xu and Wenhan Wang and Hanjing Su and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2210.06719},
  year   = {2023}
}

备注

Accepted by NeurIPS 2023