中文

多臂老虎机与强化学习中分布性后悔的统一框架

机器学习 2026-05-08 v2 机器学习

摘要

我们通过统一框架研究随机多臂老虎机和episodic强化学习中的后悔分布。我们将分布性后悔界 formalized为在所有置信水平δ(0,1]\delta \in (0,1]上均匀成立的概率保证,从而刻画后悔分布在整个δ\delta范围内的行为。我们提出一种简单的UCBVI风格算法,其探索奖励为min{c1,k/N,c2,k/N}\min\{c_{1,k}/N, c_{2,k}/\sqrt{N}\},其中NN表示访问计数,(c1,k,c2,k)(c_{1,k},c_{2,k})为用户指定的参数。对于任意参数序列,我们推导一般的无gap独立和gap依赖的分布性后悔界,提供了参数如何控制在期望性能、尾部风险和实例相关行为之间进行权衡的原则性刻画。特别地,我们的界限在minimax和实例相关 regime中都实现了期望后悔和分布性后悔的最优权衡。作为特殊情况,对于拥有A个臂且时限为T的多臂老虎机,我们获得后悔分布界为O(ATlog(1/δ))\mathcal{O}(\sqrt{AT}\log(1/\delta)),首次确认了Lattimore & Szepesv\\'{i} (2020, Section 17.1)的猜想。

关键词

引用

@article{arxiv.2605.05102,
  title  = {Unified Framework of Distributional Regret in Multi-Armed Bandits and Reinforcement Learning},
  author = {Harin Lee and Min-hwan Oh},
  journal= {arXiv preprint arXiv:2605.05102},
  year   = {2026}
}

备注

Accepted at the Conference of Learning Theory (COLT) 2026