基于图反馈的对抗性组合半环形算法
机器学习
2025-09-17 v7 信息论
math.IT
机器学习
摘要
在组合半环形中,学习者反复从组合决策集合中选择臂,接收实现的奖励总和,并观察所选臂的奖励作为反馈。本文将该框架扩展至包括图反馈,即学习者观察所选臂在反馈图 中所有相邻臂的奖励。我们证明在时间范围 内的最优后悔 regret 规模为 ,其中 为组合决策的大小, 为 的独立数。该结果在已知后悔 (即 完全)和 (即 仅有自环)之间插值,其中 为臂的总数。关键技术要点是实现一个随机决策向量,用于凸化动作,具有负相关性。我们还指出,仅在期望实现凸化动作的在线随机镜像梯度(OSMD)是次优的。此外,我们描述了通用容量下的组合半环形问题,并应用我们的結果派生出改进的上界,可能独有兴趣。
引用
@article{arxiv.2502.18826,
title = {Adversarial Combinatorial Semi-bandits with Graph Feedback},
author = {Yuxiao Wen},
journal= {arXiv preprint arXiv:2502.18826},
year = {2025}
}
备注
To appear in ICML 2025