基于信赖域的多约束安全分布强化学习
机器学习
2023-12-27 v2 人工智能
摘要
在安全性关键的机器人任务中,必须减少潜在故障并满足多重约束,例如避免碰撞、限制能耗和保持平衡。因此,在此类机器人任务中应用安全强化学习(RL)需要处理多约束,并使用风险厌恶约束而非风险中性约束。为此,我们提出一种用于多约束的基于信赖域的安全 RL 算法,称为安全分布 actor-critic(SDAC)。我们的主要贡献如下:1)引入梯度集成方法以处理多约束问题中的不可行问题,确保理论收敛;2)开发 TD() 目标分布以低偏差估计风险厌恶约束。我们通过涉及多约束和单约束机器人任务的大量实验评估 SDAC。在保持高分的同时,与安全的 RL 基线相比,SDAC 在多约束任务中满足所有约束所需的步数减少 1.93 倍,在单约束任务中约束违反次数减少 1.78 倍。代码见:https://github.com/rllab-snu/Safe-Distributional-Actor-Critic。
引用
@article{arxiv.2301.10923,
title = {Trust Region-Based Safe Distributional Reinforcement Learning for Multiple Constraints},
author = {Dohyeong Kim and Kyungjae Lee and Songhwai Oh},
journal= {arXiv preprint arXiv:2301.10923},
year = {2023}
}
备注
32 pages, Accepted at NeurIPS 2023