中文

PAC-贝叶斯强化学习训练可泛化的策略

机器学习 2026-02-10 v2 人工智能 机器学习

摘要

我们推导了一个新的PAC-贝叶斯泛化界限,用于强化学习,显式地考虑数据中的马尔可夫依赖关系,通过链的混合时间。这一工作克服了获取强化学习泛化保证的挑战,其中数据序列的性质破坏了经典界限所基于的独立性假设。新的界限为现代无策略算法如Soft Actor-Critic提供了非空的证明。我们通过PB-SAC算法演示了该界限的实际效用,该算法在训练期间优化该界限以指导探索。跨越多个连续控制任务的实验表明,所提出的方法在保持竞争性能的同时,提供了有意义的置信区间。

关键词

引用

@article{arxiv.2510.10544,
  title  = {PAC-Bayesian Reinforcement Learning Trains Generalizable Policies},
  author = {Abdelkrim Zitouni and Mehdi Hennequin and Juba Agoun and Ryan Horache and Nadia Kabachi and Omar Rivasplata},
  journal= {arXiv preprint arXiv:2510.10544},
  year   = {2026}
}