带随机约束的在线凸优化:零约束违反与bandit反馈
最优化与控制
2023-07-17 v2 机器学习
摘要
本文研究带随机约束的在线凸优化。我们提出一种漂移加惩罚(drift-plus-penalty)算法的变体,保证在经过固定次数的迭代后达到O()期望遗憾和零约束违反,这改进了具有O()约束违反的原始漂移加惩罚方法。与原始漂移加惩罚方法不同,我们的算法对时间范围T的长度不可知。这基于我们新颖的漂移引理,该引理提供了对虚拟队列漂移的时变界,并由此导出对期望虚拟队列长度的时变界。此外,我们将框架扩展到两点bandit反馈下的随机约束在线凸优化。我们表明,通过将我们的算法框架适配到bandit反馈设定,仍可实现O()期望遗憾和零约束违反,改进了先前关于相同约束函数情形的工作。数值结果证明了我们的理论结果。
引用
@article{arxiv.2301.11267,
title = {Online Convex Optimization with Stochastic Constraints: Zero Constraint Violation and Bandit Feedback},
author = {Yeongjong Kim and Dabeen Lee},
journal= {arXiv preprint arXiv:2301.11267},
year = {2023}
}
备注
We found a paper that has already obtained the results of the submission