探索层次感知的逆强化学习
人工智能
2018-07-16 v1 人机交互
摘要
我们在贝叶斯逆强化学习(BIRL)框架下引入了一种新的人类规划生成模型,该模型考虑了人类常使用层次化策略进行规划这一事实。我们描述了用于推断层次化规划者价值的贝叶斯逆层次强化学习(BIHRL)算法,并使用一个说明性玩具模型表明,在标准 BIRL 失效之处 BIHRL 仍保持准确性。此外,BIHRL 能够准确预测“Wikispeedia”游戏玩家的目标,模型中层次结构的引入带来了准确率的显著提升。我们表明,即便仅对智能体可用规划的层次结构具有弱先验,BIHRL 也能显著优于 BIRL,并讨论了将该框架扩展到更真实场景所面临的重大挑战。
引用
@article{arxiv.1807.05037,
title = {Exploring Hierarchy-Aware Inverse Reinforcement Learning},
author = {Chris Cundy and Daniel Filan},
journal= {arXiv preprint arXiv:1807.05037},
year = {2018}
}
备注
Presented at the first Workshop on Goal Specifications for Reinforcement Learning, ICML 2018, Stockholm, Sweden