中文

当等待不是一种选择:基于审慎代价学习选项

人工智能 2017-09-15 v1

摘要

近期研究表明,时间扩展动作(选项)可以完全端到端地学习,而非预先指定。尽管“如何”学习选项的问题已日益清晰,但“什么是好的选项”这一问题仍难以捉摸。我们在有限理性框架(Simon, 1957)中通过审慎代价(deliberation cost)的概念,阐述了我们对“好”选项应为何物的回答。随后,我们推导了实用的基于梯度的学习算法来实现该目标。我们在街机学习环境(ALE)中的结果表明,性能和可解释性均得到提升。

关键词

引用

@article{arxiv.1709.04571,
  title  = {When Waiting is not an Option : Learning Options with a Deliberation Cost},
  author = {Jean Harb and Pierre-Luc Bacon and Martin Klissarov and Doina Precup},
  journal= {arXiv preprint arXiv:1709.04571},
  year   = {2017}
}