面向时变约束的在线凸优化中的结构化约束违规与报酬界限
机器学习
2026-03-17 v1
摘要
具有时变约束的在线凸优化(OCO)是动态网络系统中顺序决策的关键框架,在该框架中,学习者必须在约束可行区域内最小化累积损失,同时这些可行区域会随着轮次的变化而变化。现有的理论分析通常将约束变化视为单一的对抗性过程,导致对实际网络动态的联合报酬和违规界限过于保守。本文引入了约束变化的结构化特征——平滑漂移、周期性循环和稀疏切换——将其映射到常见的网络现象,如信道衰落、日间流量模式和离散维护窗口。我们推导了结构化相关的联合界限,相对于对抗性速率具有严格改进。为实现这些收益,我们提出了结构自适应原始-对偶(SA-PD)算法,利用可观测约束信号在线检测环境结构并相应调整对偶更新策略。在合成基准和真实数据集上的大量实验——包括在线电力调度和变压器负荷管理——表明,SA-PD 在约束违规方面相对于结构无关基线可降低最高 53%,同时保持具竞争力的效用。本工作为在受约束的在线学习中利用时序规律性以实现稳健网络工程提供了综合性指南。
引用
@article{arxiv.2603.14319,
title = {Structure-Dependent Regret and Constraint Violation Bounds for Online Convex Optimization with Time-Varying Constraints},
author = {Xiufeng Liu and Qian Chen and Zhijin Wang and Ruyu Liu},
journal= {arXiv preprint arXiv:2603.14319},
year = {2026}
}