中文

基于拉普拉斯变分循环网络的贝叶斯元强化学习

机器学习 2025-11-20 v1 机器学习

摘要

元强化学习通过在任务分布上训练单个强化学习智能体,以便在测试时快速泛化到训练集之外的新任务。从贝叶斯视角看,这可解释为对训练任务后验分布进行 amortize 变分推断。在各种元强化学习方法中,常见做法是使用循环神经网络表示该分布的点估计。我们展示,如何通过拉普拉斯近似(无论是在学习开始、期间或之后)对该点估计进行增强,以获得完整分布,而无需修改基础模型架构。通过该近似,我们能够估计非贝叶斯智能体的分布统计量(如熵),观察到基于点估计的方法会产生过度自信的估计器,且不满足一致性。此外,在与基于完整分布学习任务后验的方法比较时,我们的方法在变分基线水平上与之相当,却拥有 far fewer 参数。

关键词

引用

@article{arxiv.2505.18591,
  title  = {Bayesian Meta-Reinforcement Learning with Laplace Variational Recurrent Networks},
  author = {Joery A. de Vries and Jinke He and Mathijs M. de Weerdt and Matthijs T. J. Spaan},
  journal= {arXiv preprint arXiv:2505.18591},
  year   = {2025}
}