中文

面向任意背包约束的多臂老虎机

机器学习 2025-01-31 v1

摘要

我们考虑的是面向任意背包约束的多臂老虎机问题(BwAK),这是一种 novel 的 BwK 问题版本,其中存在而非总体约束预算。这种问题设置引入了额外的复杂性,因为它要求在决策过程中始终满足约束条件。我们提出了SUAK算法,利用上置置信界来识别最优臂混合物,同时在探索与开发之间保持平衡。SUAK是一种自适应算法,能够在决策过程中战略性地利用每轮中可用预算,并在可能违反任意时成本约束时跳过一轮。具体而言,SUAK略微低于利用可用成本预算,以减少跳过轮次的需求。我们证明SUAK在较简单的BwK框架下已建立的O(KlogT)O(K \log T)问题相关后悔上界相同。最后,我们提供仿真结果以验证SUAK在实际场景中的实用性。

关键词

引用

@article{arxiv.2501.18560,
  title  = {Bandits with Anytime Knapsacks},
  author = {Eray Can Elumar and Cem Tekin and Osman Yagan},
  journal= {arXiv preprint arXiv:2501.18560},
  year   = {2025}
}