中文

从生成式到情景式:样本高效的可复制强化学习

机器学习 2025-07-17 v1

摘要

实证科学和机器学习中普遍存在的不可复现性最近推动了对可复现学习算法的形式化研究 [Impagliazzo et al. (2022)]。在数据来自固定独立同分布源的批处理设置中(例如,假设检验、监督学习),数据高效的可复现算法的设计现在已基本被理解。相比之下,在强化学习等控制设置中,智能体必须直接与变化的环境交互,我们的知识仍存在显著差距。Karbasi 等人表明,在访问具有 SS 个状态和 AA 个动作的环境生成模型(RL 的“批处理设置”)的情况下,可复现地学习一个近似最优策略仅需 O~(S2A2)\tilde{O}(S^2A^2) 个样本。另一方面,由于环境探索的巨大困难,无生成模型情况下的最佳上界跃升至 O~(S7A7)\tilde{O}(S^7 A^7) [Eaton et al. (2024)]。这一差距引出了可复现性更广泛理论中的一个关键问题:可复现探索本质上是否比批处理学习更昂贵?样本高效的可复现强化学习是否可能?在这项工作中,我们(近乎)解决了这个问题(针对低视界表格 MDP):探索并非可复现学习的重大障碍!我们的主要结果是一个基于 O~(S2A)\tilde{O}(S^2A) 个样本的可复现强化学习算法,弥合了生成式设置与情景式设置之间的差距。我们对此进行了补充:在生成式设置下(在常见的并行采样假设下)给出了匹配的 Ω~(S2A)\tilde{\Omega}(S^2A) 下界,并在情景式设置下给出了 Ω~(S2)\tilde{\Omega}(S^2) 的无条件下界,展示了我们的算法在状态空间 SS 方面的近最优性。

关键词

引用

@article{arxiv.2507.11926,
  title  = {From Generative to Episodic: Sample-Efficient Replicable Reinforcement Learning},
  author = {Max Hopkins and Sihan Liu and Christopher Ye and Yuichi Yoshida},
  journal= {arXiv preprint arXiv:2507.11926},
  year   = {2025}
}

备注

67 pages