中文

组合多臂老虎机的离线学习

机器学习 2025-05-30 v2

摘要

组合多臂老虎机(CMAB)是一种基础的序贯决策框架,在过去十年中得到了广泛研究。然而,现有工作主要集中于在线环境,忽略了在线交互的巨大成本以及现成的离线数据集。为了克服这些局限性,我们引入了 Off-CMAB,这是首个针对 CMAB 的离线学习框架。我们框架的核心是组合下置信界(CLCB)算法,它将悲观的奖励估计与组合求解器相结合。为了刻画离线数据集的质量,我们提出了两种新颖的数据覆盖条件,并证明在这些条件下,CLCB 实现了近乎最优的次优性差距,在相差一个对数因子的情况下匹配了理论下界。我们通过实际应用验证了 Off-CMAB,包括排序学习、大型语言模型(LLM)缓存和社交影响力最大化,展示了其处理非线性奖励函数、一般反馈模型以及排除最优甚至可行动作的分布外动作样本的能力。在合成和真实数据集上的大量实验进一步突显了 CLCB 的卓越性能。

关键词

引用

@article{arxiv.2501.19300,
  title  = {Offline Learning for Combinatorial Multi-armed Bandits},
  author = {Xutong Liu and Xiangxiang Dai and Jinhang Zuo and Siwei Wang and Carlee Joe-Wong and John C. S. Lui and Wei Chen},
  journal= {arXiv preprint arXiv:2501.19300},
  year   = {2025}
}