中文

极小探索分配策略的渐近行为:几乎必然、任意缓慢增长的悔值

机器学习 2015-12-18 v2 机器学习

摘要

本文旨在通过建立与两类简单分配策略π\pi相关的样本(或“伪”)悔值的概率为1的有限时域界和收敛速率,来进一步理解序列分配(“随机多臂老虎机”,即MAB)问题的结构。对于任何缓慢增长函数gg,在温和正则性约束下,我们构造了两种策略(gg-Forcing 和 gg-Inflated Sample Mean),它们实现了阶为O(g(n))O(g(n))的悔值度量(当nn \to \infty时几乎必然,上下界均成立)。此外,还建立了余项项的几乎必然上下界。在此处的构造中,函数gg有效地控制了经典“探索/利用”权衡中的“探索”。

关键词

引用

@article{arxiv.1505.02865,
  title  = {Asymptotic Behavior of Minimal-Exploration Allocation Policies: Almost Sure, Arbitrarily Slow Growing Regret},
  author = {Wesley Cowan and Michael N. Katehakis},
  journal= {arXiv preprint arXiv:1505.02865},
  year   = {2015}
}