从无休止到情境化:有限时段改进的阈值型多臂偏置问题重构
机器学习
2026-04-07 v5
摘要
本文针对现有在线"无休止偏置"(RB)算法在有限时段性能较差的现象进行研究,这种现象源于为每个代理学习完整"马尔可夫决策过程"(MDP)的样本复杂度过高。我们认为,实现更好的有限时段性能需要快速收敛到高质量的政策。因此,我们引入了将在线RB重新表述为"预算约束阈值型情境偏置"的模型,通过将长期状态转换编码为标量奖励来简化学习问题。我们证明了针对简化有限时段设置的第一个非渐近最优性。我们提出了一种针对异构代理、多状态环境的实用学习政策,表明其实现次线性懊恼,实现比现有方法更快的收敛。这直接导致更高的累积奖励,经实证验证在大型异构环境中相对于最先进算法实现了显著的收益。代码已提供在github上。我们的工作为在有限时段RB中实现实用、样本高效学习提供了新路径。
引用
@article{arxiv.2502.05145,
title = {From Restless to Contextual: A Thresholding Bandit Reformulation For Finite-horizon Improvement},
author = {Jiamin Xu and Ivan Nazarov and Aditya Rastogi and África Periáñez and Kyra Gan},
journal= {arXiv preprint arXiv:2502.05145},
year = {2026}
}