中文

非平稳多臂赌博机的约束反馈学习

机器学习 2025-09-19 v1

摘要

非平稳多臂赌博机通过引入检测和响应奖励分布变化的机制,使智能体能够适应变化的环境,因此非常适合动态设置。然而,现有方法通常假设每轮都有奖励反馈可用——这一假设忽略了许多反馈受限的真实场景。在本文中,我们迈出了重要一步,在非平稳多臂赌博机中引入了一种新的约束反馈模型,其中奖励反馈的可用性受到限制。我们提出了首个无需先验知识(即不需要预先知道非平稳程度)的先验自由算法,在该设置下实现了近似最优的动态遗憾。具体而言,我们的算法达到了动态遗憾 O~(K1/3VT1/3T/B1/3)\tilde{\mathcal{O}}(K^{1/3}V_T^{1/3}T/B^{1/3}),其中 TT 为轮数,KK 为臂数,BB 为查询预算,VTV_T 为捕捉非平稳程度的变化预算。

关键词

引用

@article{arxiv.2509.15073,
  title  = {Constrained Feedback Learning for Non-Stationary Multi-Armed Bandits},
  author = {Shaoang Li and Jian Li},
  journal= {arXiv preprint arXiv:2509.15073},
  year   = {2025}
}