中文

非平稳环境下的赌博机凸优化

机器学习 2020-07-07 v2 机器学习

摘要

赌博机凸优化(BCO)是对具有部分信息的序贯决策进行建模的基本框架,其中玩家可获得的唯一反馈是一点或两点函数值。本文中,我们研究非平稳环境下的 BCO,并选取动态遗憾(dynamic regret)作为性能度量,其定义为算法产生的累积损失与任意可行比较器序列的累积损失之差。令 TT 为时间范围,PTP_T 为反映环境非平稳性的比较器序列的路径长度。我们提出一种新颖算法,对一点和两点反馈模型分别实现 O(T3/4(1+PT)1/2)O(T^{3/4}(1+P_T)^{1/2})O(T1/2(1+PT)1/2)O(T^{1/2}(1+P_T)^{1/2}) 的动态遗憾。后一结果是最优的,与本文建立的 Ω(T1/2(1+PT)1/2)\Omega(T^{1/2}(1+P_T)^{1/2}) 下界相匹配。值得注意的是,我们的算法对非平稳环境更具适应性,因为它不需要提前获知路径长度 PTP_T 的先验知识,而该量通常是未知的。

关键词

引用

@article{arxiv.1907.12340,
  title  = {Bandit Convex Optimization in Non-stationary Environments},
  author = {Peng Zhao and Guanghui Wang and Lijun Zhang and Zhi-Hua Zhou},
  journal= {arXiv preprint arXiv:1907.12340},
  year   = {2020}
}