中文

带随机约束的在线凸优化:零约束违反与bandit反馈

最优化与控制 2023-07-17 v2 机器学习

摘要

本文研究带随机约束的在线凸优化。我们提出一种漂移加惩罚(drift-plus-penalty)算法的变体,保证在经过固定次数的迭代后达到O(T\sqrt{T})期望遗憾和零约束违反,这改进了具有O(T\sqrt{T})约束违反的原始漂移加惩罚方法。与原始漂移加惩罚方法不同,我们的算法对时间范围T的长度不可知。这基于我们新颖的漂移引理,该引理提供了对虚拟队列漂移的时变界,并由此导出对期望虚拟队列长度的时变界。此外,我们将框架扩展到两点bandit反馈下的随机约束在线凸优化。我们表明,通过将我们的算法框架适配到bandit反馈设定,仍可实现O(T\sqrt{T})期望遗憾和零约束违反,改进了先前关于相同约束函数情形的工作。数值结果证明了我们的理论结果。

关键词

引用

@article{arxiv.2301.11267,
  title  = {Online Convex Optimization with Stochastic Constraints: Zero Constraint Violation and Bandit Feedback},
  author = {Yeongjong Kim and Dabeen Lee},
  journal= {arXiv preprint arXiv:2301.11267},
  year   = {2023}
}

备注

We found a paper that has already obtained the results of the submission