极小探索分配策略的渐近行为:几乎必然、任意缓慢增长的悔值
机器学习
2015-12-18 v2 机器学习
摘要
本文旨在通过建立与两类简单分配策略相关的样本(或“伪”)悔值的概率为1的有限时域界和收敛速率,来进一步理解序列分配(“随机多臂老虎机”,即MAB)问题的结构。对于任何缓慢增长函数,在温和正则性约束下,我们构造了两种策略(-Forcing 和 -Inflated Sample Mean),它们实现了阶为的悔值度量(当时几乎必然,上下界均成立)。此外,还建立了余项项的几乎必然上下界。在此处的构造中,函数有效地控制了经典“探索/利用”权衡中的“探索”。
引用
@article{arxiv.1505.02865,
title = {Asymptotic Behavior of Minimal-Exploration Allocation Policies: Almost Sure, Arbitrarily Slow Growing Regret},
author = {Wesley Cowan and Michael N. Katehakis},
journal= {arXiv preprint arXiv:1505.02865},
year = {2015}
}