离散与连续强化学习中的安全感知任务组合
机器学习
2023-06-30 v1 人工智能
摘要
组合性是可扩展系统设计的关键方面。强化学习(RL)近期在任务学习中展现出显著成功,但直到最近才真正开始利用组合。在本文中,我们关注已学习任务布尔组合,而非函数式或序贯组合。现有的 RL 布尔组合聚焦于在具有离散动作空间的环境中到达满足的吸收态,但不支持可组合的安全性(即规避)约束。我们通过三项贡献推进了已学习任务布尔组合的技术水平:i)在该框架中引入两种不同的安全性概念;ii)展示如何强制任一种安全语义,证明正确性(在某些假设下),并分析两种安全概念之间的权衡;以及 iii)将布尔组合从离散动作空间扩展到连续动作空间。我们使用网格世界中价值迭代的修改版本、具有图像观测的网格世界中的 Deep Q-Network (DQN),以及连续观测与连续动作 Bullet 物理环境中的 Twin Delayed DDPG (TD3) 演示了这些技术。我们相信这些贡献通过允许满足安全性质的策略的零样本组合,推进了安全强化学习的理论。
引用
@article{arxiv.2306.17033,
title = {Safety-Aware Task Composition for Discrete and Continuous Reinforcement Learning},
author = {Kevin Leahy and Makai Mann and Zachary Serlin},
journal= {arXiv preprint arXiv:2306.17033},
year = {2023}
}