非平稳多臂赌博机的约束反馈学习
机器学习
2025-09-19 v1
摘要
非平稳多臂赌博机通过引入检测和响应奖励分布变化的机制,使智能体能够适应变化的环境,因此非常适合动态设置。然而,现有方法通常假设每轮都有奖励反馈可用——这一假设忽略了许多反馈受限的真实场景。在本文中,我们迈出了重要一步,在非平稳多臂赌博机中引入了一种新的约束反馈模型,其中奖励反馈的可用性受到限制。我们提出了首个无需先验知识(即不需要预先知道非平稳程度)的先验自由算法,在该设置下实现了近似最优的动态遗憾。具体而言,我们的算法达到了动态遗憾 ,其中 为轮数, 为臂数, 为查询预算, 为捕捉非平稳程度的变化预算。
引用
@article{arxiv.2509.15073,
title = {Constrained Feedback Learning for Non-Stationary Multi-Armed Bandits},
author = {Shaoang Li and Jian Li},
journal= {arXiv preprint arXiv:2509.15073},
year = {2025}
}