具有过滤反馈的组合多臂老虎机
机器学习
2017-05-29 v1 机器学习
摘要
受搜索与检测问题的启发,我们提出了一种组合多臂老虎机 (CMAB) 问题的解决方案,该问题具有重尾奖励分布以及一类新的反馈——过滤半强盗反馈。在 CMAB 问题中,智能体每轮从集合 中拉取臂的组合,从这些臂关联的概率分布生成随机结果并接收总体奖励。在半强盗反馈下,假设生成的随机结果均被观测到。过滤半强盗反馈允许观测到的结果从以初始随机结果为条件的第二分布中采样。该反馈机制很有价值,因为它允许将 CMAB 方法应用于顺序搜索与检测问题,其中采取组合动作,但真实奖励(该轮中出现的感兴趣对象数量)未被观测到,而是过滤后的奖励(搜索者成功找到的对象数量,按定义必须少于出现的数量)。我们提出一种上置信界类型算法 Robust-F-CUCB,以及相关的阶为 的悔界,以在奖励过滤和重尾奖励分布面前平衡探索与利用。
引用
@article{arxiv.1705.09605,
title = {Combinatorial Multi-Armed Bandits with Filtered Feedback},
author = {James A. Grant and David S. Leslie and Kevin Glazebrook and Roberto Szechtman},
journal= {arXiv preprint arXiv:1705.09605},
year = {2017}
}
备注
16 pages