具有图反馈的交叉学习情境 Bandit 问题的近乎紧界
机器学习
2025-02-10 v1
摘要
具有图反馈的交叉学习情境 Bandit 问题最近引起了广泛关注。在此设置中,存在一个情境 Bandit,其臂上有一个反馈图,拉动一个臂会揭示反馈图中所有相邻臂在所有情境下的损失。该问题最初由 Han 等人 (2024) 提出,在诸如第一价格拍卖中的出价等领域具有广泛应用,并探索了 Bandit 问题反馈结构的新前沿。一个关键的理论问题是是否存在一个具有 遗憾的算法,其中 表示反馈图的独立数。这个问题特别有趣,因为它涉及一个算法能否实现完全独立于情境数量且匹配普通图 Bandit 极小极大遗憾的遗憾界。先前的工作已经证明,对于对抗性情境,这样的算法是不可能的,但对于随机情境,该问题仍然悬而未决。在这项工作中,我们通过提出一种算法,为具有图反馈和随机情境的交叉学习情境 Bandit 实现了极小极大 遗憾,从而肯定地回答了这个开放问题。值得注意的是,尽管该问题即使对于随机 Bandit 也是开放的,我们直接解决了该问题严格更强的对抗性 Bandit 版本。
引用
@article{arxiv.2502.04678,
title = {Nearly Tight Bounds for Cross-Learning Contextual Bandits with Graphical Feedback},
author = {Ruiyuan Huang and Zengfeng Huang},
journal= {arXiv preprint arXiv:2502.04678},
year = {2025}
}