中文

多面体不稳定性支配在线学习中的后悔

机器学习 2026-05-14 v1 计算复杂性

摘要

许多在组合动作上的在线决策问题通过凸松弛求解,导致具有分段线性目标和诱导多面体结构的在线凸优化。在本文中,我们表明此类问题的后悔由多面体不稳定性支配:即活跃区域变化次数。在完全信息反馈和固定分区假设下,若 RST\mathrm{RS}_T 表示区域切换次数,VmaxV_{\max} 表示每个区域的最大顶点数,则我们证明 \RegretT=Θ((1+RST)TlogVmax)\Regret_T= \Theta(\sqrt{(1+\mathrm{RS}_T)\,T\,\log V_{\max})} 在专家类方法和维度相关 OCO 速率之间进行插值。对于在洛瓦茨凸化下进行的在线亚调和-凸函数游戏,这简化为置换切换计数 SCT\mathrm{SC}_T,得到匹配速率 \RegretT=Θ((1+SCT)Tlogn)\Regret_T= \Theta(\sqrt{(1+\mathrm{SC}_T)\,T\,\log n})。在合成和真实组合问题(最短路径、影响最大化)上的实验验证了预测的标度,并指出低不稳定性在实际中可以以无显式动作枚举的方式出现。

关键词

引用

@article{arxiv.2605.13692,
  title  = {Polyhedral Instability Governs Regret in Online Learning},
  author = {Yuetai Li and Fengqing Jiang and Yichen Feng and Kaiyuan Zheng and Luyao Niu and Bhaskar Ramasubramanian and Basel Alomair and Linda Bushnell and Radha Poovendran},
  journal= {arXiv preprint arXiv:2605.13692},
  year   = {2026}
}