中文

未知支撑均匀多臂老虎机的渐近最优策略

机器学习 2015-09-25 v3 机器学习

摘要

考虑一个控制器从有限个 N2N \geq 2 的总体中依次抽样的问题,这些总体由随机变量 XkiX^i_k 指定,i=1,,N, i = 1,\ldots , N,k=1,2,k = 1, 2, \ldots;其中 XkiX^i_k 表示第 ii 个总体第 kk 次被抽样时的结果。假设对每个固定的 ii{Xki}k1\{ X^i_k \}_{k \geq 1} 是某个区间 [ai,bi][a_i, b_i] 上独立同分布的均匀随机变量序列,其支撑(即 ai,bia_i, b_i)对控制器未知。目标是制定一个策略 π\pi,基于可用数据,在任意时刻 n=1,2,n=1,2,\ldots 决定从 NN 个总体中的哪一个抽样,以最大化 nn 次抽样的期望结果总和,或等价地,最小化因缺乏参数 {ai}\{ a_i \}{bi}\{ b_i \} 信息而产生的后悔。本文提出一种简单的膨胀样本均值(ISM)型策略,其在后悔达到 Burnetas 和 Katehakis (1996) 渐近下界的意义上是渐近最优的。此外,给出了有限时间域后悔界。

关键词

引用

@article{arxiv.1505.01918,
  title  = {An Asymptotically Optimal Policy for Uniform Bandits of Unknown Support},
  author = {Wesley Cowan and Michael N. Katehakis},
  journal= {arXiv preprint arXiv:1505.01918},
  year   = {2015}
}

备注

arXiv admin note: text overlap with arXiv:1504.05823