多面体不稳定性支配在线学习中的后悔
机器学习
2026-05-14 v1 计算复杂性
摘要
许多在组合动作上的在线决策问题通过凸松弛求解,导致具有分段线性目标和诱导多面体结构的在线凸优化。在本文中,我们表明此类问题的后悔由多面体不稳定性支配:即活跃区域变化次数。在完全信息反馈和固定分区假设下,若 表示区域切换次数, 表示每个区域的最大顶点数,则我们证明 在专家类方法和维度相关 OCO 速率之间进行插值。对于在洛瓦茨凸化下进行的在线亚调和-凸函数游戏,这简化为置换切换计数 ,得到匹配速率 。在合成和真实组合问题(最短路径、影响最大化)上的实验验证了预测的标度,并指出低不稳定性在实际中可以以无显式动作枚举的方式出现。
引用
@article{arxiv.2605.13692,
title = {Polyhedral Instability Governs Regret in Online Learning},
author = {Yuetai Li and Fengqing Jiang and Yichen Feng and Kaiyuan Zheng and Luyao Niu and Bhaskar Ramasubramanian and Basel Alomair and Linda Bushnell and Radha Poovendran},
journal= {arXiv preprint arXiv:2605.13692},
year = {2026}
}