部分受控环境下用于逆强化学习的层次贝叶斯模型
机器学习
2023-05-18 v1 机器人学
摘要
使用逆强化学习(IRL)从真实世界观察中学习的机器人,可能在环境中遇到除专家以外、在演示过程中产生干扰观察的物体或智能体。这些混杂元素通常在完全受控环境(如虚拟仿真或实验室环境)中被移除。当无法完全移除时,必须过滤掉这些干扰观察。然而,在大量观察的情况下,识别观察的来源是困难的。为此,我们提出一种层次贝叶斯模型,该模型同时纳入专家和混杂元素的观察,从而显式地对机器人可能接收到的多样化观察进行建模。我们扩展了一种现有 IRL 算法(其最初设计用于专家部分遮挡情形)以考虑多样化观察。在一个包含遮挡与混杂元素的模拟机器人分拣领域中,我们证明了该模型的有效性。具体而言,我们的技术优于其他几种对比方法,仅逊于拥有受试者轨迹完美知识的情况。
引用
@article{arxiv.2107.05818,
title = {A Hierarchical Bayesian model for Inverse RL in Partially-Controlled Environments},
author = {Kenneth Bogert and Prashant Doshi},
journal= {arXiv preprint arXiv:2107.05818},
year = {2023}
}
备注
8 pages, 10 figures