中文

深度高斯过程近端策略优化

机器学习 2025-12-22 v2

摘要

对强化学习(RL)进行不确定性估计是控制任务中的关键组件,因为智能体必须在安全探索和高效学习之间进行权衡。虽然深度神经网络已在 RL 中取得突破,但它们往往缺乏校准的不确定性估计。我们引入深度高斯过程近端策略优化(GPPO),这是一种可扩展且无模型的 actor-critic 算法,利用深度高斯过程(DGPs)来近似策略和价值函数。GPPO 在标准的高维连续控制基准上保持与近端策略优化(PPO)的竞争性能,同时提供经过校准的不确定性估计,可用于更安全、更有效的探索。

关键词

引用

@article{arxiv.2511.18214,
  title  = {Deep Gaussian Process Proximal Policy Optimization},
  author = {Matthijs van der Lende and Juan Cardenas-Cartagena},
  journal= {arXiv preprint arXiv:2511.18214},
  year   = {2025}
}

备注

Withdrawn by the authors as the manuscript is not yet complete; no updated version is available at this time