超越 $\tilde{O}(\sqrt{T})$ 约束违反:针对对抗约束的在线凸优化
机器学习
2025-11-17 v2 最优化与控制
机器学习
摘要
我们研究了具有对抗约束的在线凸优化(Online Convex Optimization with adversarial constraints, COCO)。在每个回合中,学习者从凸决策集中选择一个动作,然后对手披露一个凸成本函数和一个凸约束函数。学习者的目标是在长度为 的时间范围内选择一系列动作,以最小化悔 regret和累积约束违反(cumulative constraint violation, CCV)。已知的最佳策略实现 的悔 regret和 的CCV。本文通过牺牲悔 regret来实现显著降低的CCV。这一权衡在安全关键应用中尤为重要,在此类应用中,满足安全约束是不可妥协的。具体而言,对于任意有界的凸成本和约束函数,我们提出一种在线策略,实现 的悔 regret和 的CCV,其中 为决策集的维数, 为可调参数。我们首先考虑一种特殊情况,即称为“受限专家问题”()的情形,其中决策集为概率单纱形,成本函数和约束函数为线性函数。基于我们提出的新型自适应小损失悔 regret下界,我们提出一种高效的策略,用于解决“受限专家问题”,可实现 的悔 regret和 的CCV,其中 为专家数量。最终通过覆盖论证,将原问题归约为“受限专家问题”。最后,在额外的 光滑性假设下,我们提出一种高效的一阶策略,实现 的悔 regret和 的CCV。
引用
@article{arxiv.2505.06709,
title = {Beyond $\tilde{O}(\sqrt{T})$ Constraint Violation for Online Convex Optimization with Adversarial Constraints},
author = {Abhishek Sinha and Rahul Vaze},
journal= {arXiv preprint arXiv:2505.06709},
year = {2025}
}
备注
To appear in NeurIPS 2025