利用交错进行的保守探索
机器学习
2018-06-05 v1 机器学习
摘要
在许多实际问题中,学习智能体可能希望在不采取任何比默认生产动作差很多的坏动作的前提下,学习到事后最优动作。一般而言这是不可能的,因为智能体必须探索未知动作(其中某些可能很坏)以学习更好的动作。然而,当动作是组合式时,若未知动作可通过与生产动作交错来进行评估,则这可能是可行的。我们将此概念形式化为带可交换动作的不确定组合半 bandit 学习。我们为该问题设计了高效学习算法,给出了其 n 步后悔界,并在合成与真实世界问题上进行了评估。我们的真实世界实验表明,所提算法能够在不违反严格生产约束(整体及受多样性约束下)的前提下,学习推荐 K 部最具吸引力电影。
引用
@article{arxiv.1806.00892,
title = {Conservative Exploration using Interleaving},
author = {Sumeet Katariya and Branislav Kveton and Zheng Wen and Vamsi K. Potluru},
journal= {arXiv preprint arXiv:1806.00892},
year = {2018}
}