中文

实现多项逻辑赌博林带的有限适应性

机器学习 2025-08-06 v1 机器学习

摘要

多项逻辑赌博林带因其能够建模多个结果的问题而近期引起广泛关注。在此设置下,每个决策与许多可能的结果相关联,通过多项逻辑函数进行建模。近期关于多项逻辑赌博林带的若干研究工作同时实现了最优的颗�和计算效率。然而,由于现实挑战和实用性,亟需开发具有有限适应性的算法,即仅允许进行 M 次政策更新。为解决这些挑战,我们提出了两种算法,B-MNL-CB 和 RS-MNL,分别采用批处理和很少切换范例。我们的第一个算法 B-MNL-CB 将分布式最优设计的概念扩展到多项设置,并在上下文在给定 Ω(log log T) 次更新轮次时生成时,实现 Õ(√T) 级颤。我们的第二个算法 RS-MNL 可与恶意生成的上下文配合工作,可在 Õ(log T) 次政策更新轮次下实现 Õ(√T) 级颤。进一步,我们进行了实验,表明我们的方法(具有固定数量的政策更新轮次)在与几个最先进的基准(这些基准在每轮中更新其政策)之之间具有极强的竞争力(往往更好),展示了该算法在各种实际场景中的适用性。

关键词

引用

@article{arxiv.2508.03072,
  title  = {Achieving Limited Adaptivity for Multinomial Logistic Bandits},
  author = {Sukruta Prakash Midigeshi and Tanmay Goyal and Gaurav Sinha},
  journal= {arXiv preprint arXiv:2508.03072},
  year   = {2025}
}

备注

Accepted to RLC 2025