中文

Quick-Draw Bandits:在具有极多臂的非平稳环境中快速优化

机器学习 2025-06-02 v1 机器学习

摘要

经典的多臂老虎机算法通常假设平稳的奖励环境,且动作空间的大小(臂数)很小。较新开发的方法通常仅放宽其中一个假设:现有的非平稳老虎机策略专为少量臂设计,而 Lipschitz、线性和高斯过程老虎机策略则设计用于在奖励函数约束下、在平稳奖励环境中处理大量(或无限)臂。在本文中,我们提出了一种新策略,利用高斯插值在连续空间上学习奖励环境。我们证明我们的方法能够高效学习连续 Lipschitz 奖励函数,且累积遗憾为 O(T)\mathcal{O}^*(\sqrt{T})。此外,我们的方法通过简单修改即可自然地扩展到非平稳问题。最后,我们证明我们的方法在计算上具有优势(快 100-10000 倍),并且在具有非平稳性和极多臂的数据集上实验优于滑动高斯过程策略。

关键词

引用

@article{arxiv.2505.24692,
  title  = {Quick-Draw Bandits: Quickly Optimizing in Nonstationary Environments with Extremely Many Arms},
  author = {Derek Everett and Fred Lu and Edward Raff and Fernando Camacho and James Holt},
  journal= {arXiv preprint arXiv:2505.24692},
  year   = {2025}
}

备注

KDD 2025, Research Track