面向模型无关安全强化学习的安全调制演员-批判方法及其在无人机悬停中的应用
人工智能
2024-10-10 v1 机器学习
机器人学
摘要
本文提出了一种安全调制演员-批判(SMAC)方法,以解决模型无关安全强化学习(RL)中的安全约束和高估值问题。开发了安全调制器以通过调制动作来满足安全约束,使策略能够忽略安全约束并专注于最大化奖励。此外,提出了一种具有理论更新规则的分布式批判家,用于缓解具有安全约束的Q值高估。仿真和真实世界场景的实验在无人机(UAV)悬停方面都表明,SMAC能够有效地维持安全约束并优于主流基线算法。
引用
@article{arxiv.2410.06847,
title = {A Safety Modulator Actor-Critic Method in Model-Free Safe Reinforcement Learning and Application in UAV Hovering},
author = {Qihan Qi and Xinsong Yang and Gang Xia and Daniel W. C. Ho and Pengyang Tang},
journal= {arXiv preprint arXiv:2410.06847},
year = {2024}
}