中文

带Bandit反馈的逻辑上下文Slate Bandits高效算法

机器学习 2026-05-13 v3

摘要

我们研究逻辑上下文Slate Bandit问题,其中智能体每轮从环境中提供的指数级大规模候选Slate集合(大小为2Ω(N)2^{\Omega(N)})中选择一个包含NN个项目的Slate。观察到单个二元奖励,由逻辑模型决定所选Slate。我们的目标是开发在TT轮内最大化累积奖励同时保持每轮低计算成本的算法。我们提出两种算法,Slate-GLM-OFU和Slate-GLM-TS,以实现这一目标。这些算法通过局部规划(独立槽位选择)实现每轮NO(1)N^{O(1)}时间复杂度,并通过全局学习(联合参数估计)实现低遗憾。在广泛研究的多样性假设下,我们证明Slate-GLM-OFU仅产生O~(T)\tilde{O}(\sqrt{T})遗憾。大量实验涵盖广泛的合成设置,证明我们的算法一致优于最先进基线,实现了最低遗憾和最快运行时间。此外,我们将算法应用于语言模型提示中选择上下文示例以解决二元分类任务(如情感分析)。我们的方法取得了具有竞争力的测试准确率,使其成为实际场景中的可行替代方案。

关键词

引用

@article{arxiv.2506.13163,
  title  = {Efficient Algorithms for Logistic Contextual Slate Bandits with Bandit Feedback},
  author = {Tanmay Goyal and Gaurav Sinha},
  journal= {arXiv preprint arXiv:2506.13163},
  year   = {2026}
}

备注

Accepted to UAI 2025