梯度变化下 Bandit Convex Optimization 的维度改进依赖
机器学习
2026-02-05 v1 机器学习
摘要
梯度变异在在线学习中引起日益关注的注意,其深刻关联到博弈论与优化等领域。该问题在完整信息设置下已有大量研究,但在 bandit 反馈下的探讨仍不足。本文聚焦于 Bandit Convex Optimization (BCO) 中的梯度变异,采用两点反馈。我们通过对非连续梯度变异进行细致分析,这一在 bandit 设置下的基本量,改进了相对于已知最佳结果 (Chiang 等 2013) 的维度依赖情况。我们改进的非连续梯度变异分析还蕴含其他有利问题相关保证,如梯度方差和小损失遗憾。除了两点设置外,我们通过演示在单点 bandit 线性优化中的第一个梯度变异界限,展示了我们技术方法的多样性。最终,我们在更具挑战性的任务中验证了结果的有效性,如动态/通用遗憾最小化和 bandit games,实现了两点 BCO 的第一个梯度变异 dynamic 与 universal 遗憾界限,以及 bandit games 中的快速收敛率。
关键词
引用
@article{arxiv.2602.04761,
title = {Improved Dimension Dependence for Bandit Convex Optimization with Gradient Variations},
author = {Hang Yu and Yu-Hu Yan and Peng Zhao},
journal= {arXiv preprint arXiv:2602.04761},
year = {2026}
}