中文

不再探索:非随机多臂老虎机的改进高概率悔界

机器学习 2015-11-04 v3 机器学习

摘要

本工作研究非随机多臂老虎机问题中的悔最小化,聚焦于以高概率成立的性能保证。此类结果在文献中相当稀少,因为证明它们需要大量技术努力,并对标准的、更直观的算法进行显著修改,而那些算法仅提供期望意义下的保证。这些修改之一是迫使学习者在 TT 轮中从均匀分布中至少采样 Ω(T)\Omega(\sqrt{T}) 次,如果存在许多次优臂,这会对性能产生不利影响。尽管广泛推测该性质对于证明高概率悔界至关重要,我们在本文中表明,无需这一不良探索成分也可能实现此类强结果。我们的结果依赖于一种简单直观的损失估计策略,称为隐式探索(Implicit eXploration, IX),它使得分析异常简洁。为证明我们技术的灵活性,我们针对标准多臂老虎机框架的各种扩展推导了若干改进的高概率界。最后,我们进行了一个简单实验,说明了隐式探索技术的鲁棒性。

关键词

引用

@article{arxiv.1506.03271,
  title  = {Explore no more: Improved high-probability regret bounds for non-stochastic bandits},
  author = {Gergely Neu},
  journal= {arXiv preprint arXiv:1506.03271},
  year   = {2015}
}

备注

To appear at NIPS 2015