中文

具有平滑悔值的情境_bandits:连续动作空间中的高效学习

机器学习 2022-07-14 v1 机器学习

摘要

设计适用于大——甚至连续——动作空间的高效通用情境_bandits(contextual bandits)算法,将有助于其在信息检索、推荐系统和连续控制等重要场景中的应用。虽然获得标准悔值保证可能是无望的,但已有替代悔值概念被提出以应对大动作设定。我们提出了情境_bandits的平滑悔值概念,它主导了先前提出的替代方案。我们针对所提出的平滑悔值设计了一种统计与计算高效的算法,该算法在标准监督预言机下使用通用函数逼近。我们还提出了一种自适应算法,可自动适应任意平滑度水平。我们的算法可用于在标准悔值下恢复先前的最小最大/Pareto最优保证,例如,在多最优臂的bandit问题和Lipschitz/Hölder bandit问题中。我们进行了大规模实证评估,证明了所提算法的有效性。

关键词

引用

@article{arxiv.2207.05849,
  title  = {Contextual Bandits with Smooth Regret: Efficient Learning in Continuous Action Spaces},
  author = {Yinglun Zhu and Paul Mineiro},
  journal= {arXiv preprint arXiv:2207.05849},
  year   = {2022}
}

备注

To appear at ICML 2022