中文

超越 $\tilde{O}(\sqrt{T})$ 约束违反:针对对抗约束的在线凸优化

机器学习 2025-11-17 v2 最优化与控制 机器学习

摘要

我们研究了具有对抗约束的在线凸优化(Online Convex Optimization with adversarial constraints, COCO)。在每个回合中,学习者从凸决策集中选择一个动作,然后对手披露一个凸成本函数和一个凸约束函数。学习者的目标是在长度为 TT 的时间范围内选择一系列动作,以最小化悔 regret和累积约束违反(cumulative constraint violation, CCV)。已知的最佳策略实现 O(T)O(\sqrt{T}) 的悔 regret和 O~(T)\tilde{O}(\sqrt{T}) 的CCV。本文通过牺牲悔 regret来实现显著降低的CCV。这一权衡在安全关键应用中尤为重要,在此类应用中,满足安全约束是不可妥协的。具体而言,对于任意有界的凸成本和约束函数,我们提出一种在线策略,实现 O~(dT+Tβ)\tilde{O}(\sqrt{dT}+ T^\beta) 的悔 regret和 O~(dT1β)\tilde{O}(dT^{1-\beta}) 的CCV,其中 dd 为决策集的维数,β[0,1]\beta \in [0,1] 为可调参数。我们首先考虑一种特殊情况,即称为“受限专家问题”(Constrained Expert\textsf{Constrained Expert})的情形,其中决策集为概率单纱形,成本函数和约束函数为线性函数。基于我们提出的新型自适应小损失悔 regret下界,我们提出一种高效的策略,用于解决“受限专家问题”,可实现 O(TlnN+Tβ)O(\sqrt{T\ln N}+T^{\beta}) 的悔 regret和 O~(T1βlnN)\tilde{O}(T^{1-\beta} \ln N) 的CCV,其中 NN 为专家数量。最终通过覆盖论证,将原问题归约为“受限专家问题”。最后,在额外的 MM 光滑性假设下,我们提出一种高效的一阶策略,实现 O(MT+Tβ)O(\sqrt{MT}+T^{\beta}) 的悔 regret和 O~(MT1β)\tilde{O}(MT^{1-\beta}) 的CCV。

关键词

引用

@article{arxiv.2505.06709,
  title  = {Beyond $\tilde{O}(\sqrt{T})$ Constraint Violation for Online Convex Optimization with Adversarial Constraints},
  author = {Abhishek Sinha and Rahul Vaze},
  journal= {arXiv preprint arXiv:2505.06709},
  year   = {2025}
}

备注

To appear in NeurIPS 2025