学习如何推荐:Logistic 多臂老虎机中的简洁后悔的 Minimax 最优
机器学习
2026-05-28 v2
摘要
我们研究的是在简单后悔目标下,使用 轮探索来输出单个最终动作的随机 logistic 多臂老虎机。logistic 结构在此尤为重要:因为 sigmoid 的局部曲率决定了动作的可获取性,对于即时奖励最佳的动作未必是最有助于识别最终最佳推荐的动作。我们指出,第一阶的 minimax 难度由 sigmoid 在最优动作处斜率的倒数 决定。下界由一个偏移饱和硬族实现,其中饱和同时限制了关于最终决策的可用信息,同时控制了来自错误推荐的价值损失。这揭示了与累积后悔构建不同的硬机制,尽管在期望下在在线到批量化简中可以恢复相同的主导级数。我们然后发展了两个曲率感知算法:MULog 是一种纯探索方法,其最终推荐满足约为 的高概率上界,匹配下界(除对数因子外),THATS 是一种基于 Thompson 抽样的方法,提供了计算更轻松的替代方案。实验在硬几何和易几何上支持相同的图景:信息丰富的低奖励动作可以显著降低实例的难度,曲率感知方法特别有效地利用了这种结构。
引用
@article{arxiv.2601.21167,
title = {Learning What to Recommend: Minimax Optimal Simple Regret in Logistic Bandits},
author = {Shuai Liu and Alireza Bakhtiari and Alex Ayoub and Botao Hao and Csaba Szepesvári},
journal= {arXiv preprint arXiv:2601.21167},
year = {2026}
}