中文

非平稳环境中的组合半_bandit问题

机器学习 2021-06-22 v2 数据结构与算法 计算机科学与博弈论 机器学习

摘要

本文研究了非平稳组合半_bandit问题,包括切换情形和动态情形。在(a)奖励函数非线性、(b)臂可能被概率性触发、以及(c)仅存在近似离线预言机的一般情形下,我们的算法在切换情形下取得O~(ST)\tilde{\mathcal{O}}(\sqrt{\mathcal{S} T})的依赖分布的遗憾,在动态情形下取得O~(V1/3T2/3)\tilde{\mathcal{O}}(\mathcal{V}^{1/3}T^{2/3}),其中S\mathcal S为切换次数,V\mathcal V为总“分布变化”之和。两种场景下的遗憾界均近乎最优,但我们的算法需要预先知道参数S\mathcal SV\mathcal V。我们进一步表明,通过采用另一种技术,我们的算法不再需要预先知道参数S\mathcal SV\mathcal V,但遗憾界可能变为次优。在奖励函数线性且拥有精确预言机的特殊情形下,我们设计了一种无参数算法,可在预先不知道参数的情况下,在切换情形和动态情形下均取得近乎最优的遗憾。

关键词

引用

@article{arxiv.2002.03580,
  title  = {Combinatorial Semi-Bandit in the Non-Stationary Environment},
  author = {Wei Chen and Liwei Wang and Haoyu Zhao and Kai Zheng},
  journal= {arXiv preprint arXiv:2002.03580},
  year   = {2021}
}

备注

Accepted to UAI 2021