中文

面向带约束随机连续臂老虎机的修正悲观-乐观学习

机器学习 2022-11-30 v2 机器学习

摘要

本文研究带约束的随机连续臂老虎机(SCBwC)问题,其中我们在连续空间 X\mathcal X 上优化黑盒奖励函数 f(x)f(x),并满足黑盒约束函数 g(x)0g(x)\leq 0。我们通过高斯过程(GPs)对奖励与约束函数建模,并提出一种修正悲观-乐观学习框架(RPOL),一种基于惩罚的方法,分别对奖励与约束函数融入乐观与悲观 GP _bandit 学习。我们考虑累积约束违反度量 t=1T(g(xt))+\sum_{t=1}^T(g(x_t))^{+},其严格强于传统长期约束违反 t=1Tg(xt)\sum_{t=1}^Tg(x_t)。RPOL 中惩罚更新的修正设计与约束函数的悲观学习保证了累积约束违反最小。RPOL 能为 SCBwC 及其变体(如延迟反馈与非平稳环境下)取得次线性后悔与累积约束违反。这些理论结果与其无约束对应版本相匹配。我们的实验证明 RPOL 优于若干现有基线算法。

关键词

引用

@article{arxiv.2211.14720,
  title  = {Rectified Pessimistic-Optimistic Learning for Stochastic Continuum-armed Bandit with Constraints},
  author = {Hengquan Guo and Qi Zhu and Xin Liu},
  journal= {arXiv preprint arXiv:2211.14720},
  year   = {2022}
}