广义逆规划:学习用于可泛化任务表示的高阶非马尔可夫效用
机器学习
2020-11-20 v1 人工智能
摘要
在寻找时间扩展任务的可泛化表示时,我们发现两个必要组成部分:效用需为非马尔可夫以迁移对概率偏移不变的时间关系,效用也需为高阶以抽象出具体接地对象。本工作中,我们研究从人类演示中学习此类效用。虽然逆强化学习(IRL)已被接受为效用学习的通用框架,其基础表述是一个具体的马尔可夫决策过程。因此学到的奖励函数并未独立于环境指定任务。超越此限制,我们定义了一个泛化域,涵盖遵循某一模式的一组规划问题。因此我们提出一个新课题——广义逆规划,用于该域中的效用学习。我们进一步勾勒了一个计算框架,最大熵逆规划(MEIP),以生成式学习非马尔可夫效用及相关概念。学到的效用和概念形成了一种任务表示,无论概率偏移或结构变化均可泛化。鉴于所提泛化问题尚未被广泛研究,我们仔细定义了评估协议,并借此在两个概念验证域和一个挑战性任务(从演示中学习折叠)上展示了 MEIP 的有效性。
引用
@article{arxiv.2011.09854,
title = {Generalized Inverse Planning: Learning Lifted non-Markovian Utility for Generalizable Task Representation},
author = {Sirui Xie and Feng Gao and Song-Chun Zhu},
journal= {arXiv preprint arXiv:2011.09854},
year = {2020}
}