中文

Bandit中保守探索的改进算法

机器学习 2020-02-11 v1 机器学习

摘要

在数字营销、医疗、金融和机器人等众多领域中,生产环境中运行一个经过充分测试且可靠的基线策略(例如推荐系统)是常见做法。然而,基线策略往往并非最优。在此情形下,期望部署在线学习算法(例如多臂bandit算法),使其与系统交互以在约束条件下学习更优/最优策略,该约束要求在学习过程中性能几乎从不差于基线本身的性能。本文中,我们研究上下文线性bandit设定下的保守学习问题,并引入一种新算法——保守约束LinUCB(CLUCB2)。我们推导了CLUCB2的后悔界,其与现有结果相匹配,并通过实证表明在多个合成和真实世界问题上它优于最先进的保守bandit算法。最后,我们考虑一种更现实的约束,即性能仅在预定义检查点(而非每一步)进行验证,并展示这一松弛约束如何有利地影响CLUCB2的后悔与实证性能。

关键词

引用

@article{arxiv.2002.03221,
  title  = {Improved Algorithms for Conservative Exploration in Bandits},
  author = {Evrard Garcelon and Mohammad Ghavamzadeh and Alessandro Lazaric and Matteo Pirotta},
  journal= {arXiv preprint arXiv:2002.03221},
  year   = {2020}
}