非平稳延迟在线凸优化:从全信息到 Bandit 设定
机器学习
2025-11-10 v4
摘要
尽管任意延迟下的在线凸优化(OCO)近来受到越来越多的关注,但以往研究聚焦于平稳环境,目标是最小化静态后悔。本文研究非平稳环境下的延迟 OCO,并选取相对于任意比较器序列的动态后悔作为性能度量。为此,我们首先针对全信息情形(可获得延迟梯度)提出一种称为 Mild-OGD 的算法。其基本思想是并行维护多个专家,每个专家根据延迟梯度的到达顺序以不同学习率执行梯度下降步,并利用元算法基于其延迟表现跟踪最优专家。尽管思路简单,我们新颖的分析表明,在有序假设下 Mild-OGD 的动态后悔可自动被 界定,最坏情况下为 ,其中 和 分别表示平均与最大延迟, 为时间范围, 为比较器的路径长度。此外,我们通过推导匹配的下界证明了最坏情况结果的最优性。最后,针对仅具延迟损失值的更具挑战性情形,我们开发了 Mild-OGD 的 bandit 变体。有趣的是,我们证明在延迟量相对较大时,我们的 bandit 算法甚至享有现有无延迟 bandit 算法的最佳动态后悔界。
引用
@article{arxiv.2305.12131,
title = {Non-stationary Delayed Online Convex Optimization: From Full-information to Bandit Setting},
author = {Yuanyu Wan and Chang Yao and Yitao Ma and Mingli Song and Lijun Zhang},
journal= {arXiv preprint arXiv:2305.12131},
year = {2025}
}
备注
Extended Version of ICML2024 with New Results on the Bandit Setting