中文

具有图反馈的交叉学习情境 Bandit 问题的近乎紧界

机器学习 2025-02-10 v1

摘要

具有图反馈的交叉学习情境 Bandit 问题最近引起了广泛关注。在此设置中,存在一个情境 Bandit,其臂上有一个反馈图,拉动一个臂会揭示反馈图中所有相邻臂在所有情境下的损失。该问题最初由 Han 等人 (2024) 提出,在诸如第一价格拍卖中的出价等领域具有广泛应用,并探索了 Bandit 问题反馈结构的新前沿。一个关键的理论问题是是否存在一个具有 O~(αT)\widetilde{O}(\sqrt{\alpha T}) 遗憾的算法,其中 α\alpha 表示反馈图的独立数。这个问题特别有趣,因为它涉及一个算法能否实现完全独立于情境数量且匹配普通图 Bandit 极小极大遗憾的遗憾界。先前的工作已经证明,对于对抗性情境,这样的算法是不可能的,但对于随机情境,该问题仍然悬而未决。在这项工作中,我们通过提出一种算法,为具有图反馈和随机情境的交叉学习情境 Bandit 实现了极小极大 O~(αT)\widetilde{O}(\sqrt{\alpha T}) 遗憾,从而肯定地回答了这个开放问题。值得注意的是,尽管该问题即使对于随机 Bandit 也是开放的,我们直接解决了该问题严格更强的对抗性 Bandit 版本。

关键词

引用

@article{arxiv.2502.04678,
  title  = {Nearly Tight Bounds for Cross-Learning Contextual Bandits with Graphical Feedback},
  author = {Ruiyuan Huang and Zengfeng Huang},
  journal= {arXiv preprint arXiv:2502.04678},
  year   = {2025}
}