中文

面向两点 bandit 反馈的在线凸优化高概率 regret 最优解

机器学习 2026-04-07 v3

摘要

我们考虑在两点 bandit 反馈下的在线凸优化(OCO)问题。在此设置下,玩家试图最小化一系列由对手生成的凸损失函数,同时仅在每个函数的两个点处观察其值。虽然已知两点反馈可用于梯度估计,但对于强凸函数的紧致高概率 regret 上界仍悬置于未解(如 \citet{agarwal2010optimal} 所述)。主要挑战在于 bandit 梯度估计的重尾特性,使得标准浓度分析困难。本文解决了此开放问题,给出 O(d(logT+log(1/δ))/μ)O(d(\log T + \log(1/\delta))/\mu) 的高概率 regret 上界,其中 μ\mu 为强凸参数。我们的结果在时间范围 TT 与维数 dd 上均达到 minimax 最优。

关键词

引用

@article{arxiv.2603.25029,
  title  = {Optimal High-Probability Regret for Online Convex Optimization with Two-Point Bandit Feedback},
  author = {Haishan Ye},
  journal= {arXiv preprint arXiv:2603.25029},
  year   = {2026}
}