面向通用安全强化学习的约束条件策略优化
机器学习
2024-05-01 v2 人工智能
摘要
安全强化学习(RL)专注于训练在预定义安全约束下最大化奖励的智能体。然而,学习能够在部署时无需重新训练即可适应不同安全约束要求的通用安全策略,仍是一个很大程度上未被探索且具有挑战性的领域。在本工作中,我们形式化了通用安全 RL 问题,并考虑两个主要需求:训练效率与零样本适应能力。为应对这些需求,我们提出了条件约束策略优化(CCPO)框架,其包含两个关键模块:(1)用于在未知阈值条件下近似价值函数的通用价值估计(VVE);(2)用于在策略优化过程中编码任意约束阈值的条件下变分推断(CVI)。我们的大量实验表明,CCPO 在安全性与任务性能上均优于基线方法,同时以数据高效的方式保持对不同约束阈值的零样本适应能力。这使得我们的方法适用于现实世界中的动态应用。
引用
@article{arxiv.2310.03718,
title = {Constraint-Conditioned Policy Optimization for Versatile Safe Reinforcement Learning},
author = {Yihang Yao and Zuxin Liu and Zhepeng Cen and Jiacheng Zhu and Wenhao Yu and Tingnan Zhang and Ding Zhao},
journal= {arXiv preprint arXiv:2310.03718},
year = {2024}
}