带 Bandit 反馈的最优随机非凸优化
机器学习
2021-03-31 v1 机器学习
摘要
本文在某些光滑性与子水平集假设下,分析了非凸代价函数的连续臂 bandit 问题。我们首先推导了简单分箱方法期望累积遗憾的上界。随后提出一种自适应分箱方法,可显著改善性能。此外,推导了极小极大下界,表明我们的新自适应方法达到了局部极小极大最优的期望累积遗憾。
引用
@article{arxiv.2103.16082,
title = {Optimal Stochastic Nonconvex Optimization with Bandit Feedback},
author = {Puning Zhao and Lifeng Lai},
journal= {arXiv preprint arXiv:2103.16082},
year = {2021}
}