中文

逆向强化学习中的约束推断基准测试

机器学习 2023-03-03 v3

摘要

在将强化学习(RL)智能体部署到物理系统中时,我们必须确保这些智能体充分了解底层约束。然而,在许多现实问题中,约束往往难以用数学形式明确指定,且对 RL 智能体而言是未知的。为应对这些问题,逆向约束强化学习(ICRL)从专家演示中经验性地估计约束。作为一个新兴的研究方向,ICRL 目前缺乏通用基准,以往工作均在手工构建的环境中使用人工生成的专家演示来测试算法。本文在包括机器人控制和自动驾驶在内的 RL 应用领域背景下构建了 ICRL 基准。针对每个环境,我们设计了相关约束并训练专家智能体以生成演示数据。此外,不同于现有学习确定性约束的基线方法,我们提出了一种变分 ICRL 方法来对候选约束的后验分布进行建模。我们在该基准下对这些算法进行了大量实验,并展示了它们如何助力研究 ICRL 的重要挑战。该基准(包含复现 ICRL 算法的说明)可在 https://github.com/Guiliang/ICRL-benchmarks-public 获取。

关键词

引用

@article{arxiv.2206.09670,
  title  = {Benchmarking Constraint Inference in Inverse Reinforcement Learning},
  author = {Guiliang Liu and Yudong Luo and Ashish Gaurav and Kasra Rezaee and Pascal Poupart},
  journal= {arXiv preprint arXiv:2206.09670},
  year   = {2023}
}