中文

强化学习中极小极大最优的奖励不可知探索

机器学习 2024-05-24 v2 信息论 系统与控制 系统与控制 math.IT 统计理论 机器学习 统计理论

摘要

本文研究强化学习(RL)中的奖励不可知探索——即学习者在探索阶段不知晓奖励函数的场景——并设计了一种优于当前最优水平的算法。更确切地说,考虑一个具有SS个状态、AA个动作和时域长度HH的有限时域非齐次马尔可夫决策过程,并假设感兴趣的可给定奖励函数数量不超过多项式级别。在无需奖励信息引导的情况下,通过收集\begin{align*} \frac{SAH^3}{\varepsilon^2} \text{ 样本回合(至多相差对数因子)} \end{align*}数量的样本,我们的算法能够为所有这些奖励函数找到ε\varepsilon-最优策略,只要ε\varepsilon足够小。这构成了该背景下首个可证明达到极小极大最优的奖励不可知探索方案。此外,一旦样本量超过S2AH3ε2\frac{S^2AH^3}{\varepsilon^2}回合(至多相差对数因子),我们的算法就能对任意多个奖励函数(即使它们被对抗性地设计)达到ε\varepsilon精度,这一任务通常被称为“无奖励探索”。我们算法设计的创新源于离线RL的洞见:探索方案试图最大化一个决定离线RL性能的关键的奖励不可知量,而策略学习范式借用了样本最优离线RL范式的思想。

关键词

引用

@article{arxiv.2304.07278,
  title  = {Minimax-Optimal Reward-Agnostic Exploration in Reinforcement Learning},
  author = {Gen Li and Yuling Yan and Yuxin Chen and Jianqing Fan},
  journal= {arXiv preprint arXiv:2304.07278},
  year   = {2024}
}

备注

accepted for presentation in COLT 2024