带弃权选项的多臂老虎机的渐近和极小极大最优遗憾界
机器学习
2026-03-24 v2 信息论
math.IT
机器学习
摘要
我们引入了经典多臂老虎机问题的一个新颖扩展,该扩展包含一个额外的策略创新:弃权。在这个增强框架中,智能体不仅需要在每个时间步选择臂,还可以在观察随机即时奖励之前选择弃权而不接受该奖励。当选择弃权时,智能体要么承受固定遗憾,要么获得有保证的奖励。这种增加的复杂性自然引出了关键问题:我们能否设计出在此设置中既计算高效又渐近和极小极大最优的算法?我们通过设计和分析其遗憾达到相应信息论下界的算法,对此问题给出了肯定回答。我们的结果为弃权选项的益处提供了有价值的定量见解,为在其他具有此类选项的在线决策问题中的进一步探索奠定了基础。广泛的数值实验验证了我们的理论结果,表明我们的方法不仅推进了理论,而且有可能带来显著的实践效益。
引用
@article{arxiv.2402.15127,
title = {Asymptotically and Minimax Optimal Regret Bounds for Multi-Armed Bandits with Abstention},
author = {Junwen Yang and Tianyuan Jin and Vincent Y. F. Tan},
journal= {arXiv preprint arXiv:2402.15127},
year = {2026}
}
备注
36 pages