中文

无约束鲁棒性在线凸优化

机器学习 2025-06-17 v1 最优化与控制

摘要

本文解决的是带有“损坏”反馈的在线学习问题。我们的学习者接收的是可能被损坏的梯度 g~t\tilde g_t 而非“真实”梯度 gtg_t。我们对损坏如何产生不作任何假设:它们可能是异常值、误标记的数据,甚至是恶意干扰的结果。我们关注困难的“无约束”设置,即算法必须对任何比较点 uRdu \in \mathbb{R}^d 保持低后悔值。无约束设置显然更具挑战性,因为现有算法即使在极小的损坏量下也会产生极高的后悔值(这在有界域的情况下并非如此)。我们的算法在已知 GmaxtgtG \ge \max_t \|g_t\| 时保证后悔值为 uG(T+k)\|u\|G (\sqrt{T} + k),其中 kk 是损坏总量的度量。当 GG 未知时,我们额外增加 (u2+G2)k(\|u\|^2+G^2) k 的加法惩罚。

关键词

引用

@article{arxiv.2506.12781,
  title  = {Unconstrained Robust Online Convex Optimization},
  author = {Jiujia Zhang and Ashok Cutkosky},
  journal= {arXiv preprint arXiv:2506.12781},
  year   = {2025}
}