面向两点 bandit 反馈的在线凸优化高概率 regret 最优解
机器学习
2026-04-07 v3
摘要
我们考虑在两点 bandit 反馈下的在线凸优化(OCO)问题。在此设置下,玩家试图最小化一系列由对手生成的凸损失函数,同时仅在每个函数的两个点处观察其值。虽然已知两点反馈可用于梯度估计,但对于强凸函数的紧致高概率 regret 上界仍悬置于未解(如 \citet{agarwal2010optimal} 所述)。主要挑战在于 bandit 梯度估计的重尾特性,使得标准浓度分析困难。本文解决了此开放问题,给出 的高概率 regret 上界,其中 为强凸参数。我们的结果在时间范围 与维数 上均达到 minimax 最优。
引用
@article{arxiv.2603.25029,
title = {Optimal High-Probability Regret for Online Convex Optimization with Two-Point Bandit Feedback},
author = {Haishan Ye},
journal= {arXiv preprint arXiv:2603.25029},
year = {2026}
}