SAAC:将安全强化学习作为演员-评论家的对抗博弈
机器学习
2022-07-07 v2 人工智能
计算机科学与博弈论
摘要
尽管强化学习(RL)对不确定性下的序贯决策问题有效,但在风险或安全为硬性约束的真实系统中仍难以施展。本文将带安全约束的RL问题表述为非零和博弈。在采用最大熵RL部署时,该表述导出一个安全对抗引导的软演员-评论家框架,称为SAAC。在SAAC中,对抗者旨在破坏安全约束,而RL智能体旨在给定对抗者策略下最大化受约束价值函数。对智能体价值函数的安全约束仅表现为智能体与对抗者策略间的一项排斥项。与先前方法不同,SAAC可处理不同安全准则,如安全探索、均值-方差风险敏感性和类CVaR一致性风险敏感性。我们阐明了针对这些约束的对抗者设计。然后,在每种变体中,我们展示智能体除学习解决任务外,还与对抗者的不安全动作相区分。最后,对于具有挑战性的连续控制任务,我们证明SAAC比风险厌恶分布RL和风险中性软演员-评论家算法实现更快收敛、更高效率及更少的安全约束违背。
引用
@article{arxiv.2204.09424,
title = {SAAC: Safe Reinforcement Learning as an Adversarial Game of Actor-Critics},
author = {Yannis Flet-Berliac and Debabrota Basu},
journal= {arXiv preprint arXiv:2204.09424},
year = {2022}
}
备注
Accepted at the 5th Multi-disciplinary Conference on Reinforcement Learning and Decision Making (RLDM 2022)