面向欺骗性环境的汤普森采样引导在线随机搜索及其在求根问题中的应用
人工智能
2017-08-08 v1
摘要
多臂赌博机问题通过一种简单而有效的机制,构成了解决广泛在线随机优化问题的基础。该问题被建模为一个赌徒反复拉动N台老虎机中的一台,从而获得随机奖励。然后,通过谨慎地平衡奖励探索与奖励利用,将奖励概率的学习与奖励最大化相结合。在本文中,我们探讨了多臂赌博机问题的一个特别有趣的变体,称为随机点定位(SPL)问题。在此问题中,赌徒仅被告知最优臂(点)位于所拉臂的“左侧”还是“右侧”,且该反馈以概率出错。因此,这种形式化捕捉了在连续动作空间中同时具有信息性和欺骗性反馈的优化问题。为了解决这类问题,我们构建了一个紧凑且可扩展的贝叶斯表示,该表示同时捕获了最优臂的位置以及接收到正确反馈的概率。我们进一步引入了伴随的汤普森采样引导随机点定位(TS-SPL)方案,以平衡探索与利用。通过学习,TS-SPL也支持在关于最优臂方向说谎的欺骗性环境中运行。这反过来又使我们能够解决基本的随机求根(SRF)问题。实证结果表明,我们的方案能够处理欺骗性和信息性环境,在SRF和SPL问题上均显著优于竞争算法。
引用
@article{arxiv.1708.01791,
title = {Thompson Sampling Guided Stochastic Searching on the Line for Deceptive Environments with Applications to Root-Finding Problems},
author = {Sondre Glimsdal and Ole-Christoffer Granmo},
journal= {arXiv preprint arXiv:1708.01791},
year = {2017}
}
备注
17 pages, 2 figures. A preliminary version of some of the results of this paper appears in the Proceedings of AIAI'15