中文

基于 PAC-Bayes 理论的终身强化学习统计保证

机器学习 2025-05-19 v2 人工智能

摘要

终身强化学习(RL)已发展为将单任务 RL 扩展至更贴近现实、动态环境的范式。在终身 RL 中,RL 智能体的“生命”被建模为来自任务分布的连续任务流。我们提出 EPIC(Empirical PAC-Bayes that Improves Continuously),一个基于 PAC-Bayes 理论设计的专为终身 RL 而构建的新型算法。EPIC 学习一个共享策略分布,称为世界策略,使其能够快速适应新任务,同时保留来自以往经验的有价值知识。我们的理论分析建立了算法泛化性能与保存在记忆中的 prior 任务数量之间的关系。我们还从 EPIC 的 RL regret 中推导出样本复杂度。广泛的实验表明,EPIC 在各种环境中显著优于现有终身 RL 方法,凭借世界策略的运用,实现了理论保证和实际有效性。

关键词

引用

@article{arxiv.2411.00401,
  title  = {Statistical Guarantees for Lifelong Reinforcement Learning using PAC-Bayes Theory},
  author = {Zhi Zhang and Chris Chow and Yasi Zhang and Yanchao Sun and Haochen Zhang and Eric Hanchen Jiang and Han Liu and Furong Huang and Yuchen Cui and Oscar Hernan Madrid Padilla},
  journal= {arXiv preprint arXiv:2411.00401},
  year   = {2025}
}

备注

9 pages, 4 figures, accepted at AISTATS 2025 (PMLR Vol 258), paper ID 9417