中文

基于图反馈的对抗性组合半环形算法

机器学习 2025-09-17 v7 信息论 math.IT 机器学习

摘要

在组合半环形中,学习者反复从组合决策集合中选择臂,接收实现的奖励总和,并观察所选臂的奖励作为反馈。本文将该框架扩展至包括图反馈,即学习者观察所选臂在反馈图 GG 中所有相邻臂的奖励。我们证明在时间范围 TT 内的最优后悔 regret 规模为 Θ~(ST+αST)\widetilde{\Theta}(S\sqrt{T}+\sqrt{\alpha ST}),其中 SS 为组合决策的大小,α\alphaGG 的独立数。该结果在已知后悔 Θ~(ST)\widetilde\Theta(S\sqrt{T})(即 GG 完全)和 Θ~(KST)\widetilde\Theta(\sqrt{KST})(即 GG 仅有自环)之间插值,其中 KK 为臂的总数。关键技术要点是实现一个随机决策向量,用于凸化动作,具有负相关性。我们还指出,仅在期望实现凸化动作的在线随机镜像梯度(OSMD)是次优的。此外,我们描述了通用容量下的组合半环形问题,并应用我们的結果派生出改进的上界,可能独有兴趣。

关键词

引用

@article{arxiv.2502.18826,
  title  = {Adversarial Combinatorial Semi-bandits with Graph Feedback},
  author = {Yuxiao Wen},
  journal= {arXiv preprint arXiv:2502.18826},
  year   = {2025}
}

备注

To appear in ICML 2025