非平稳环境中的组合半_bandit问题
机器学习
2021-06-22 v2 数据结构与算法
计算机科学与博弈论
机器学习
摘要
本文研究了非平稳组合半_bandit问题,包括切换情形和动态情形。在(a)奖励函数非线性、(b)臂可能被概率性触发、以及(c)仅存在近似离线预言机的一般情形下,我们的算法在切换情形下取得的依赖分布的遗憾,在动态情形下取得,其中为切换次数,为总“分布变化”之和。两种场景下的遗憾界均近乎最优,但我们的算法需要预先知道参数或。我们进一步表明,通过采用另一种技术,我们的算法不再需要预先知道参数或,但遗憾界可能变为次优。在奖励函数线性且拥有精确预言机的特殊情形下,我们设计了一种无参数算法,可在预先不知道参数的情况下,在切换情形和动态情形下均取得近乎最优的遗憾。
引用
@article{arxiv.2002.03580,
title = {Combinatorial Semi-Bandit in the Non-Stationary Environment},
author = {Wei Chen and Liwei Wang and Haoyu Zhao and Kai Zheng},
journal= {arXiv preprint arXiv:2002.03580},
year = {2021}
}
备注
Accepted to UAI 2021