AutoCost:面向零违例强化学习的演化内在代价
机器学习
2023-01-26 v1 人工智能
机器人学
摘要
安全性是制约深度强化学习(RL)应用于现实控制任务的关键障碍。为此,约束强化学习利用代价函数提升约束马尔可夫决策过程中的安全性。然而,此类约束 RL 方法即便在代价上限为零时仍无法实现零违例。本文分析了该失败的原因,指出恰当的代价函数在约束 RL 中起着重要作用。受此分析启发,我们提出 AutoCost,一种简单而有效的框架,可自动搜索有助于约束 RL 实现零违例性能的代价函数。我们在安全 RL 基准 Safety Gym 上验证了所提方法及搜索得到的代价函数。我们将使用我们代价函数提供附加内在代价的增强智能体,与仅使用外在代价且采用相同策略学习器的基线智能体进行比较。结果表明,在所有环境中,带内在代价的收敛策略均实现了零约束违例,且性能与基线相当。
引用
@article{arxiv.2301.10339,
title = {AutoCost: Evolving Intrinsic Cost for Zero-violation Reinforcement Learning},
author = {Tairan He and Weiye Zhao and Changliu Liu},
journal= {arXiv preprint arXiv:2301.10339},
year = {2023}
}