针对线性消失噪声的随机凸 Bandit 正则化在线牛顿方法
最优化与控制
2025-01-22 v1 机器学习
机器学习
摘要
我们研究了一个假设子高斯噪声参数随学习者选择的动作越来越接近凸损失函数的最小值而线性减小的随机凸 Bandit 问题。基于 arXiv:2406.06506 中的在线牛顿方法(ONM),我们提出了正则化在线牛顿方法(RONM)来解决该问题。我们的 RONM 在时间范围为 时达到对数 regret,这恢复了 arXiv:2402.12042 中线性 Bandit 结果。我们的分析依赖于 ONM 中精度矩阵 的增长率,我们发现线性增长恰好解决了该问题。这些分析也有助于获得更快的收敛速度,当损失函数增长更快时。我们还研究并分析了两种新的 Bandit 模型:噪声按子高斯参数函数比例缩放的随机凸 Bandit 以及带有随机乘法噪声的凸 Bandit。
引用
@article{arxiv.2501.11127,
title = {A Regularized Online Newton Method for Stochastic Convex Bandits with Linear Vanishing Noise},
author = {Jingxin Zhan and Yuchen Xin and Kaicheng Jin and Zhihua Zhang},
journal= {arXiv preprint arXiv:2501.11127},
year = {2025}
}