PIGDreamer:基于特权信息引导的安全部分可观测强化学习
机器学习
2025-09-24 v2
摘要
部分可观测性是安全强化学习中的重要挑战,因为它阻碍了潜在风险和奖励的识别。利用特定类型的特权信息在训练期间来缓解部分可观测性的影响,已取得显著的经验性成功。在本文中,我们提出了Asymmetric Constrained Partially Observable Markov Decision Processes (ACPOMDPs) 以理论上检验在安全RL中纳入特权信息的优势。基于ACPOMDPs,我们提出了 Privileged Information Guided Dreamer (PIGDreamer),这是一种基于模型的RL方法,利用特权信息通过特权表征对齐和非对称actor-critic结构来提高代理人的安全性和性能。我们的经验结果表明,PIGDreamer显著优于现有的安全RL方法。此外,与替代性特权RL方法相比,我们的方法在性能、鲁棒性和效率方面都有所提升。代码可在 https://github.com/hggforget/PIGDreamer 获取。
关键词
引用
@article{arxiv.2508.02159,
title = {PIGDreamer: Privileged Information Guided World Models for Safe Partially Observable Reinforcement Learning},
author = {Dongchi Huang and Jiaqi Wang and Yang Li and Chunhe Xia and Tianle Zhang and Kaige Zhang},
journal= {arXiv preprint arXiv:2508.02159},
year = {2025}
}
备注
ICML 2025