组合多变量多臂老虎机及其在情景强化学习等中的应用
机器学习
2025-04-24 v3
摘要
我们提出了一种新的组合多臂老虎机框架,具有多变量和概率触发臂(CMAB-MT),其中每个臂的结果是一个维多变量随机变量,反馈遵循一般的臂触发过程。与现有的CMAB工作相比,CMAB-MT不仅增强了建模能力,而且通过利用多变量随机变量的不同统计特性允许改进结果。对于CMAB-MT,我们提出了一般的1-范数多变量和触发概率调制平滑条件,以及基于该条件的乐观CUCB-MT算法。我们的框架可以将许多重要问题作为应用,例如情景强化学习和商品分布的概率最大覆盖,所有这些都满足上述平滑条件,并且与现有工作相比实现了匹配或改进的遗憾界。通过我们的新框架,我们建立了情景强化学习与CMAB文献之间的第一个联系,通过CMAB的视角提供了解决情景强化学习的新角度,这可能促进这两个重要方向之间的更多互动。
引用
@article{arxiv.2406.01386,
title = {Combinatorial Multivariant Multi-Armed Bandits with Applications to Episodic Reinforcement Learning and Beyond},
author = {Xutong Liu and Siwei Wang and Jinhang Zuo and Han Zhong and Xuchuang Wang and Zhiyong Wang and Shuai Li and Mohammad Hajiesmaili and John C. S. Lui and Wei Chen},
journal= {arXiv preprint arXiv:2406.01386},
year = {2025}
}