从演示中学习任务规约
机器学习
2018-10-30 v5 人工智能
计算机科学中的逻辑
摘要
现实世界的应用常常自然地分解为若干子任务。在许多场景(例如机器人学)中,演示提供了一种指定子任务的自然方式。然而,大多数从演示中学习的方法要么不能保证为子任务学得的构件可以安全地组合,要么限制了可用的组合类型。受此不足之驱动,我们考虑如下问题:从在不确定的随机环境中运行的智能体所提供的演示中推断布尔非马尔可夫奖励(也称为逻辑轨迹性质或规约)。至关重要的是,规约允许定义明确的组合规则,这些规则通常易于解释。在本文中,我们将规约推断任务形式化为一个最大后验概率推断问题,应用最大熵原理推导出一个解析的演示似然模型,并给出了一种在大型候选规约池中搜索最可能规约的高效方法。在我们的实验中,我们展示了学习规约如何有助于避免因临时奖励组合而经常出现的常见问题。
引用
@article{arxiv.1710.03875,
title = {Learning Task Specifications from Demonstrations},
author = {Marcell Vazquez-Chanlatte and Susmit Jha and Ashish Tiwari and Mark K. Ho and Sanjit A. Seshia},
journal= {arXiv preprint arXiv:1710.03875},
year = {2018}
}
备注
NIPS 2018