中文

带 Bandit 反馈的最优随机非凸优化

机器学习 2021-03-31 v1 机器学习

摘要

本文在某些光滑性与子水平集假设下,分析了非凸代价函数的连续臂 bandit 问题。我们首先推导了简单分箱方法期望累积遗憾的上界。随后提出一种自适应分箱方法,可显著改善性能。此外,推导了极小极大下界,表明我们的新自适应方法达到了局部极小极大最优的期望累积遗憾。

关键词

引用

@article{arxiv.2103.16082,
  title  = {Optimal Stochastic Nonconvex Optimization with Bandit Feedback},
  author = {Puning Zhao and Lifeng Lai},
  journal= {arXiv preprint arXiv:2103.16082},
  year   = {2021}
}