中文

强化学习中基于 bandit 反馈的良好策略纯粹探索

机器学习 2026-05-25 v1

摘要

在episodic强化学习中,纯粹探索主要关注最佳策略识别(BPI),即在高置信度下识别一个(近)最优策略。为了解决实际场景中“足够好”的策略就足够的需求,我们研究了另一种目标,即良好策略识别(GPI)。对于给定的奖励阈值μ0\mu_0,GPI仅要求识别一个在episode中预期奖励至少为μ0\mu_0的策略(正实例),或声明None(如果不存在此类策略,负实例)。我们在固定置信度设置下 formalized GPI。我们要求输出以概率1δ\geq 1-\delta正确,并寻求最小化预期样本复杂度,即为输出所探索的episode的预期数量。我们提出了一种新算法BEE-GPI,并为其正负实例的样本复杂度推导了理论依据的上界。值得注意的是,对于正实例,我们上界中log1/δ\log 1/\delta的系数为O(H2/(Vμ0)2)O(H^2/(V^* - \mu_0)^2),其中HH为episode长度,VV^*为episode中最优预期奖励。该系数不依赖于动作和状态空间的大小,这与BPI中的样本复杂度形成鲜明的对比。我们进一步建立了下界结果,表明BEE-GPI接近最优,以及1/(Vμ)21/(V^* -\mu)^2项的必要性。数值实验进一步验证了我们方法的效率。

关键词

引用

@article{arxiv.2605.23182,
  title  = {Pure Exploration for a Good Policy in Reinforcement Learning with Bandit Feedback},
  author = {Zitian Li and Wang Chi Cheung},
  journal= {arXiv preprint arXiv:2605.23182},
  year   = {2026}
}