中文

多重选择组合半老虎机问题

机器学习 2025-09-15 v1

摘要

在组合半老虎机(CSB)问题中,玩家从组合动作空间中选择一个动作,并观察包含在该动作中的基础臂的反馈。尽管 CSB 广泛适用于组合优化问题,但其对二元决策空间的限制排除了涉及非负整数流或分配的重要情形,例如最优传输和背包问题。为克服这一局限性,我们提出了多重选择组合半老虎机(MP-CSB),其中玩家可以选择非负整数动作,并在每轮中从单个臂观察多重反馈。我们为 MP-CSB 提出了两种算法。一种是基于 Thompson 采样的算法,即使动作空间相对于臂的数量呈指数级增长,该算法在计算上也是可行的,并且在随机环境下能达到 O(logT)O(\log T) 的分布相关遗憾,其中 TT 为时间跨度。另一种是兼顾两种环境的算法,它在随机环境下达到 O(logT)O(\log T) 的方差相关遗憾,并在对抗环境下达到最坏情况 O~(T)\tilde{\mathcal{O}}\left( \sqrt{T} \right) 的遗憾。此外,其在对抗环境下的遗憾是数据相关的,能自适应于最优动作的累积损失、总二次变差以及损失序列的路径长度。最后,我们通过数值实验表明,所提出的算法优于 CSB 文献中的现有方法。

关键词

引用

@article{arxiv.2509.09933,
  title  = {Multi-Play Combinatorial Semi-Bandit Problem},
  author = {Shintaro Nakamura and Yuko Kuroki and Wei Chen},
  journal= {arXiv preprint arXiv:2509.09933},
  year   = {2025}
}