具有平滑悔值的情境_bandits:连续动作空间中的高效学习
机器学习
2022-07-14 v1 机器学习
摘要
设计适用于大——甚至连续——动作空间的高效通用情境_bandits(contextual bandits)算法,将有助于其在信息检索、推荐系统和连续控制等重要场景中的应用。虽然获得标准悔值保证可能是无望的,但已有替代悔值概念被提出以应对大动作设定。我们提出了情境_bandits的平滑悔值概念,它主导了先前提出的替代方案。我们针对所提出的平滑悔值设计了一种统计与计算高效的算法,该算法在标准监督预言机下使用通用函数逼近。我们还提出了一种自适应算法,可自动适应任意平滑度水平。我们的算法可用于在标准悔值下恢复先前的最小最大/Pareto最优保证,例如,在多最优臂的bandit问题和Lipschitz/Hölder bandit问题中。我们进行了大规模实证评估,证明了所提算法的有效性。
引用
@article{arxiv.2207.05849,
title = {Contextual Bandits with Smooth Regret: Efficient Learning in Continuous Action Spaces},
author = {Yinglun Zhu and Paul Mineiro},
journal= {arXiv preprint arXiv:2207.05849},
year = {2022}
}
备注
To appear at ICML 2022