未知支撑均匀多臂老虎机的渐近最优策略
机器学习
2015-09-25 v3 机器学习
摘要
考虑一个控制器从有限个 的总体中依次抽样的问题,这些总体由随机变量 指定, 且 ;其中 表示第 个总体第 次被抽样时的结果。假设对每个固定的 , 是某个区间 上独立同分布的均匀随机变量序列,其支撑(即 )对控制器未知。目标是制定一个策略 ,基于可用数据,在任意时刻 决定从 个总体中的哪一个抽样,以最大化 次抽样的期望结果总和,或等价地,最小化因缺乏参数 和 信息而产生的后悔。本文提出一种简单的膨胀样本均值(ISM)型策略,其在后悔达到 Burnetas 和 Katehakis (1996) 渐近下界的意义上是渐近最优的。此外,给出了有限时间域后悔界。
引用
@article{arxiv.1505.01918,
title = {An Asymptotically Optimal Policy for Uniform Bandits of Unknown Support},
author = {Wesley Cowan and Michael N. Katehakis},
journal= {arXiv preprint arXiv:1505.01918},
year = {2015}
}
备注
arXiv admin note: text overlap with arXiv:1504.05823