多臂老虎机与强化学习中分布性后悔的统一框架
机器学习
2026-05-08 v2 机器学习
摘要
我们通过统一框架研究随机多臂老虎机和episodic强化学习中的后悔分布。我们将分布性后悔界 formalized为在所有置信水平上均匀成立的概率保证,从而刻画后悔分布在整个范围内的行为。我们提出一种简单的UCBVI风格算法,其探索奖励为,其中表示访问计数,为用户指定的参数。对于任意参数序列,我们推导一般的无gap独立和gap依赖的分布性后悔界,提供了参数如何控制在期望性能、尾部风险和实例相关行为之间进行权衡的原则性刻画。特别地,我们的界限在minimax和实例相关 regime中都实现了期望后悔和分布性后悔的最优权衡。作为特殊情况,对于拥有A个臂且时限为T的多臂老虎机,我们获得后悔分布界为,首次确认了Lattimore & Szepesv\\'{i} (2020, Section 17.1)的猜想。
引用
@article{arxiv.2605.05102,
title = {Unified Framework of Distributional Regret in Multi-Armed Bandits and Reinforcement Learning},
author = {Harin Lee and Min-hwan Oh},
journal= {arXiv preprint arXiv:2605.05102},
year = {2026}
}
备注
Accepted at the Conference of Learning Theory (COLT) 2026