中文

逆强化学习中利用结构基序的奖励学习

机器学习 2022-09-28 v1 人工智能

摘要

逆强化学习(IRL)问题在过去几年中快速发展,在机器人、认知和健康等领域有着重要应用。在这项工作中,我们探讨了当前IRL方法在从展现长时序、复杂序列任务的专业轨迹中学习智能体奖励函数时的不足。我们假设,赋予IRL模型捕捉底层任务的结构基序能够促成并提升其性能。随后,我们提出了一种新颖的IRL方法SMIRL,它首先学习任务的(近似)结构(以有限状态自动机FSA表示),然后利用该结构基序求解IRL问题。我们在离散网格世界和高维连续域环境中测试了我们的模型。我们通过实验表明,我们提出的方法成功学习了全部四项复杂任务,而两个基础IRL基线方法均告失败。我们的模型在较简单的玩具任务上也以更少的样本优于基线。我们进一步在具有组合奖励函数的修改连续域任务中展示了有前景的测试结果。

关键词

引用

@article{arxiv.2209.13489,
  title  = {Reward Learning using Structural Motifs in Inverse Reinforcement Learning},
  author = {Raeid Saqur},
  journal= {arXiv preprint arXiv:2209.13489},
  year   = {2022}
}