如何在近端策略优化中启用不确定性估计
机器学习
2022-10-10 v1 人工智能
多智能体系统
机器人学
摘要
尽管深度强化学习(RL)智能体已在诸多领域展现出强劲性能,但其固有不透明性及此类系统在实际应用中的安全性仍是重大关切。为克服这些问题,我们需要能够量化不确定性并检测分布外(OOD)状态的智能体。现有不确定性估计技术,如蒙特卡洛丢弃(Monte-Carlo Dropout)或深度集成(Deep Ensembles),尚未在基于策略的深度 RL 中广泛采用。我们认为这源于两点:与监督学习相比,不确定性与 OOD 状态等概念定义不明,尤其对于基于策略的 RL 方法;其次,RL 中不确定性估计方法的可用实现与对比研究有限。为弥补第一点差距,我们提出 Actor-Critic RL 算法(即近端策略优化(PPO))中不确定性与 OOD 的定义,并给出可能的适用度量。我们特别讨论了值不确定性与策略不确定性的概念。第二点通过实现不同不确定性估计方法并在多个环境中对比得以解决。OOD 检测性能通过为各类 RL 环境定制的分布内(ID)与 OOD 状态评估基准进行评价。我们发现奖励与 OOD 检测性能之间存在权衡。为此,我们构建了一个帕累托优化问题,同时优化奖励与 OOD 检测性能。实验表明,近期提出的 Masksembles 方法在所调研方法中取得了有利平衡,在匹配原始 RL 智能体性能的同时,实现了高质量不确定性估计与 OOD 检测。
引用
@article{arxiv.2210.03649,
title = {How to Enable Uncertainty Estimation in Proximal Policy Optimization},
author = {Eugene Bykovets and Yannick Metz and Mennatallah El-Assady and Daniel A. Keim and Joachim M. Buhmann},
journal= {arXiv preprint arXiv:2210.03649},
year = {2022}
}