中文

探索层次感知的逆强化学习

人工智能 2018-07-16 v1 人机交互

摘要

我们在贝叶斯逆强化学习(BIRL)框架下引入了一种新的人类规划生成模型,该模型考虑了人类常使用层次化策略进行规划这一事实。我们描述了用于推断层次化规划者价值的贝叶斯逆层次强化学习(BIHRL)算法,并使用一个说明性玩具模型表明,在标准 BIRL 失效之处 BIHRL 仍保持准确性。此外,BIHRL 能够准确预测“Wikispeedia”游戏玩家的目标,模型中层次结构的引入带来了准确率的显著提升。我们表明,即便仅对智能体可用规划的层次结构具有弱先验,BIHRL 也能显著优于 BIRL,并讨论了将该框架扩展到更真实场景所面临的重大挑战。

关键词

引用

@article{arxiv.1807.05037,
  title  = {Exploring Hierarchy-Aware Inverse Reinforcement Learning},
  author = {Chris Cundy and Daniel Filan},
  journal= {arXiv preprint arXiv:1807.05037},
  year   = {2018}
}

备注

Presented at the first Workshop on Goal Specifications for Reinforcement Learning, ICML 2018, Stockholm, Sweden