中文

高维空间中少数变量的连续臂老虎机问题

机器学习 2014-08-25 v4

摘要

我们考虑臂由 [0,1]^d 索引的连续臂老虎机(continuum armed bandits)的随机和对抗设置。假设奖励函数 r:[0,1]^d -> R 本质上仅依赖于最多 k 个坐标变量,即 r(x_1,..,x_d) = g(x_{i_1},..,x_{i_k}),其中 i_1,..,i_k 是来自 {1,..,d} 的不同且未知的索引,g:[0,1]^k -> R 是某个具有指数 0 < alpha <= 1 的局部 Hölder 连续函数。首先,假设 (i_1,..,i_k) 随时间固定,我们提出对 CAB1 算法的一个简单修改,通过构造离散采样点集,获得关于遗憾(regret)的 O(n^((alpha+k)/(2*alpha+k)) (log n)^((alpha)/(2*alpha+k)) C(k,d)) 界,其中 C(k,d) 最多关于 k 呈多项式依赖,关于 d 呈次对数依赖。该构造基于将 {1,..,d} 划分为 k 个不相交子集,且具有概率性,因此我们的结果以高概率成立。其次,我们将结果扩展以处理更一般的情况,即 (i_1,...,i_k) 可随时间变化,并推导了相应的遗憾界。

关键词

引用

@article{arxiv.1304.5793,
  title  = {Continuum armed bandit problem of few variables in high dimensions},
  author = {Hemant Tyagi and Bernd Gärtner},
  journal= {arXiv preprint arXiv:1304.5793},
  year   = {2014}
}

备注

(1) Appeared in proceedings of 11th Workshop on Approximation and Online Algorithms (WAOA 2013). (2) Corrected minor typos in previous version (3) 17 pages