无约束动作空间中赌博机在线优化的遗憾最小化
最优化与控制
2020-05-05 v3 机器学习
摘要
我们考虑具有零阶预言反馈的在线凸优化。特别地,决策者不知道时变代价函数的显式表示,或其梯度。在每步,她观测到在其所选动作处评估的相应代价函数的值(零阶预言)。目标是最小化遗憾,即她累积的代价之和与若她事先已知代价函数序列时一个静态最优动作的代价之和之间的差。我们提出一种新颖算法以在无约束动作空间中最小化遗憾。我们的算法基于根据其观测值对代价函数梯度进行单点估计的经典思想。该算法独立于问题参数。令 表示零阶预言的查询次数, 表示问题维度,所实现的遗憾率为 。此外,我们将所提算法适配于具有两点反馈的设置,并证明该适配过程达到了 遗憾的理论下界。
引用
@article{arxiv.1806.05069,
title = {Minimizing Regret of Bandit Online Optimization in Unconstrained Action Spaces},
author = {Tatiana Tatarenko and Maryam Kamgarpour},
journal= {arXiv preprint arXiv:1806.05069},
year = {2020}
}