垃圾进,奖励出:多臂老虎机中的自助法引导探索
机器学习
2019-06-24 v3 机器学习
摘要
我们提出了一种通过随机化其奖励历史来进行探索的赌博机算法。具体而言,它在自身历史的非参数自助样本中以伪奖励拉动具有最高平均奖励的臂。我们设计的伪奖励使得自助均值以足够高的概率为乐观值。我们将该算法称为 Giro,意为垃圾进,奖励出。我们在伯努利赌博机中分析了 Giro,并推导了其 轮遗憾的 界,其中 为最优臂与最佳次优臂期望奖励之差, 为臂的数量。我们探索设计的主要优势在于其易于推广到结构化问题。为展示这一点,我们提出了带有任意奖励泛化模型的上下文 Giro。我们在多个合成与真实世界问题上评估了 Giro 及其上下文变体,观察到其表现良好。
引用
@article{arxiv.1811.05154,
title = {Garbage In, Reward Out: Bootstrapping Exploration in Multi-Armed Bandits},
author = {Branislav Kveton and Csaba Szepesvari and Sharan Vaswani and Zheng Wen and Mohammad Ghavamzadeh and Tor Lattimore},
journal= {arXiv preprint arXiv:1811.05154},
year = {2019}
}
备注
Proceedings of the 36th International Conference on Machine Learning