中文

在上下文老虎机中利用离线回归预言机适应错误设定

机器学习 2021-06-14 v2 机器学习

摘要

计算高效的上下文老虎机通常基于利用过去数据估计给定上下文和臂的奖励预测模型。然而,当奖励模型设定不佳时,老虎机算法可能产生意外的后悔,因此近期工作聚焦于对错误设定具有鲁棒性的算法。我们提出了一类简单的上下文老虎机算法,当存在证据表明错误设定正引起后悔增加时,其通过回退到良好的安全策略来适应错误设定误差。我们的算法仅需要一个离线回归预言机,即可保证后悔界随平均错误设定水平的度量而优雅退化。与先前工作相比,我们获得了类似的后悔保证,但不依赖主算法,且不需要更鲁棒的预言机如在线或约束回归预言机(例如Foster等人(2020a);Krishnamurthy等人(2020))。这使我们能够为更一般的函近似类设计算法。

关键词

引用

@article{arxiv.2102.13240,
  title  = {Adapting to Misspecification in Contextual Bandits with Offline Regression Oracles},
  author = {Sanath Kumar Krishnamurthy and Vitor Hadad and Susan Athey},
  journal= {arXiv preprint arXiv:2102.13240},
  year   = {2021}
}

备注

ICML 2021