强化学习中基于 bandit 反馈的良好策略纯粹探索
机器学习
2026-05-25 v1
摘要
在episodic强化学习中,纯粹探索主要关注最佳策略识别(BPI),即在高置信度下识别一个(近)最优策略。为了解决实际场景中“足够好”的策略就足够的需求,我们研究了另一种目标,即良好策略识别(GPI)。对于给定的奖励阈值,GPI仅要求识别一个在episode中预期奖励至少为的策略(正实例),或声明None(如果不存在此类策略,负实例)。我们在固定置信度设置下 formalized GPI。我们要求输出以概率正确,并寻求最小化预期样本复杂度,即为输出所探索的episode的预期数量。我们提出了一种新算法BEE-GPI,并为其正负实例的样本复杂度推导了理论依据的上界。值得注意的是,对于正实例,我们上界中的系数为,其中为episode长度,为episode中最优预期奖励。该系数不依赖于动作和状态空间的大小,这与BPI中的样本复杂度形成鲜明的对比。我们进一步建立了下界结果,表明BEE-GPI接近最优,以及项的必要性。数值实验进一步验证了我们方法的效率。
引用
@article{arxiv.2605.23182,
title = {Pure Exploration for a Good Policy in Reinforcement Learning with Bandit Feedback},
author = {Zitian Li and Wang Chi Cheung},
journal= {arXiv preprint arXiv:2605.23182},
year = {2026}
}