深度高斯过程近端策略优化
机器学习
2025-12-22 v2
摘要
对强化学习(RL)进行不确定性估计是控制任务中的关键组件,因为智能体必须在安全探索和高效学习之间进行权衡。虽然深度神经网络已在 RL 中取得突破,但它们往往缺乏校准的不确定性估计。我们引入深度高斯过程近端策略优化(GPPO),这是一种可扩展且无模型的 actor-critic 算法,利用深度高斯过程(DGPs)来近似策略和价值函数。GPPO 在标准的高维连续控制基准上保持与近端策略优化(PPO)的竞争性能,同时提供经过校准的不确定性估计,可用于更安全、更有效的探索。
引用
@article{arxiv.2511.18214,
title = {Deep Gaussian Process Proximal Policy Optimization},
author = {Matthijs van der Lende and Juan Cardenas-Cartagena},
journal= {arXiv preprint arXiv:2511.18214},
year = {2025}
}
备注
Withdrawn by the authors as the manuscript is not yet complete; no updated version is available at this time