基于奖励网络蒸馏的跨异质示范者的联合目标与策略推断
机器学习
2020-11-24 v3 人工智能
机器人学
机器学习
摘要
强化学习(RL)作为学习如何决策的通用框架已取得巨大成功。然而,此成功依赖于RL专家对奖励函数的交互式手工调节。另一方面,逆强化学习(IRL)旨在从易获取的人类示范中学习奖励函数。但IRL存在两主要局限:1)奖励模糊性——可解释专家示范的奖励函数有无穷多个;2)异质性——人类专家采用不同策略与偏好,由于示范者寻求最大化同一奖励的普遍假设,从多示范者学习十分困难。本工作中,我们提出一种通过网络蒸馏联合推断任务目标与人类策略偏好的方法。该方法使我们能提炼出鲁棒的任务奖励(解决奖励模糊性)并建模各策略的目标(处理异质性)。我们证明了算法能在两个模拟任务与真实世界乒乓球任务中更好地恢复任务奖励与策略奖励并模仿各策略。
引用
@article{arxiv.2001.00503,
title = {Joint Goal and Strategy Inference across Heterogeneous Demonstrators via Reward Network Distillation},
author = {Letian Chen and Rohan Paleja and Muyleng Ghuy and Matthew Gombolay},
journal= {arXiv preprint arXiv:2001.00503},
year = {2020}
}
备注
In Proceedings of the 2020 ACM/IEEE In-ternational Conference on Human-Robot Interaction (HRI '20), March 23 to 26, 2020, Cambridge, United Kingdom.ACM, New York, NY, USA, 10 pages