中文

从具有未知奖励的演示中学习安全约束

机器学习 2024-03-05 v2 人工智能 机器学习

摘要

我们提出用于强化学习的凸约束学习(CoCoRL),一种从一组可能具有不同奖励函数的安全演示中推断约束马尔可夫决策过程(CMDP)中共享约束的新方法。先前工作局限于具有已知奖励或完全已知环境动力学的演示,而CoCoRL可在无需环境动力学知识的情况下,从具有不同未知奖励的演示学习约束。CoCoRL基于演示构建凸安全集,可证明即使对可能次优(但安全)的演示也能保证安全。对于近最优演示,CoCoRL收敛到真实安全集且无策略遗憾。我们在网格世界环境和具有多个约束的驾驶模拟中评估CoCoRL。CoCoRL学习到导致安全驾驶行为的约束。重要的是,我们可将学习到的约束安全迁移至不同任务和环境。相比之下,基于逆强化学习(IRL)的替代方法常表现不佳并学到不安全策略。

关键词

引用

@article{arxiv.2305.16147,
  title  = {Learning Safety Constraints from Demonstrations with Unknown Rewards},
  author = {David Lindner and Xin Chen and Sebastian Tschiatschek and Katja Hofmann and Andreas Krause},
  journal= {arXiv preprint arXiv:2305.16147},
  year   = {2024}
}

备注

Presented at the International Conference on Artificial Intelligence and Statistics (AISTATS) 2024