中文

面向模型无关安全强化学习的安全调制演员-批判方法及其在无人机悬停中的应用

人工智能 2024-10-10 v1 机器学习 机器人学

摘要

本文提出了一种安全调制演员-批判(SMAC)方法,以解决模型无关安全强化学习(RL)中的安全约束和高估值问题。开发了安全调制器以通过调制动作来满足安全约束,使策略能够忽略安全约束并专注于最大化奖励。此外,提出了一种具有理论更新规则的分布式批判家,用于缓解具有安全约束的Q值高估。仿真和真实世界场景的实验在无人机(UAV)悬停方面都表明,SMAC能够有效地维持安全约束并优于主流基线算法。

关键词

引用

@article{arxiv.2410.06847,
  title  = {A Safety Modulator Actor-Critic Method in Model-Free Safe Reinforcement Learning and Application in UAV Hovering},
  author = {Qihan Qi and Xinsong Yang and Gang Xia and Daniel W. C. Ho and Pengyang Tang},
  journal= {arXiv preprint arXiv:2410.06847},
  year   = {2024}
}