中文

突破 $O(\sqrt{T})$ 累积约束违规限制:在约束在线凸优化中实现 $O(\sqrt{T})$ 静态懊悔

机器学习 2026-03-24 v1 机器学习

摘要

考虑约束在线凸优化问题,其中在每个回合,学习者提交一个动作 xtXRdx_t \in \mathcal{X} \subset \mathbb{R}^d,随后揭示一个凸损失函数 ftf_t 和一个凸约束函数 gtg_t,后者驱动约束 gt(x)0g_t(x)\le 0。目标是同时最小化与基准的静态懊悔,后者提前知道所有 ftf_tgtg_t,并选择一个在所有 gt(x)0g_t(x)\le 0 下均可行的静态最优动作。近期的先行工作 Sinha and Vaze [2024] 提出了具有同时懊悔 O(T)O(\sqrt{T}) 和累积约束违规(CCV)O(T)O(\sqrt{T}) 或在特定情况下(例如当 d=1d=1 时)CCV O(1)O(1) 的算法。人们普遍认为,当 d2d\ge 2 时,所有确保懊悔为 O(T)O(\sqrt{T}) 的算法在最坏情况输入下,CCV 为 Ω(T)\Omega(\sqrt{T})。本文我们驳斥了这一观点,证明了当 d=2d=2 时,Vaze and Sinha [2025] 的算法同时实现懊悔 O(T)O(\sqrt{T}) 和 CCV O(T1/3)O(T^{1/3})

关键词

引用

@article{arxiv.2603.20671,
  title  = {Breaking the $O(\sqrt{T})$ Cumulative Constraint Violation Barrier while Achieving $O(\sqrt{T})$ Static Regret in Constrained Online Convex Optimization},
  author = {Haricharan Balasundaram and Karthick Krishna Mahendran and Rahul Vaze},
  journal= {arXiv preprint arXiv:2603.20671},
  year   = {2026}
}