中文

强化学习的高效表示学习

人工智能 2015-09-09 v1

摘要

马尔可夫决策过程(Markov decision processes, MDPs)是解决不确定性下序贯决策问题的被广泛研究的框架。基于动态规划求解 MDPs 的精确方法(如策略迭代与值迭代)在小型问题上有效。在具有大型离散状态空间或连续状态空间的问题中,紧凑表示对于提供 MDPs 的高效近似解至关重要。常用的近似算法包括构造基函数将值函数投影到低维子空间,以及构建因子化或分层图模型来分解转移与奖励函数。然而,为给定强化学习(reinforcement learning, RL)任务手动编写良好的紧凑表示相当困难且耗时。近期方法试图自动发现用于 RL 的高效表示。在本论文提案中,我们讨论基于核的 RL(一种学习值函数非参数近似的流行方法)中自动构造结构化核的问题。我们探索由基础核利用上下文无关文法组合构建的核结构空间。我们考察一种用于在该结构空间上搜索的贪心算法。为展示所学结构如何以紧凑性和效率来表示并近似原始 RL 问题,我们计划在合成问题上评估我们的方法,并与其他 RL 基线进行比较。

关键词

引用

@article{arxiv.1509.02413,
  title  = {Learning Efficient Representations for Reinforcement Learning},
  author = {Yanping Huang},
  journal= {arXiv preprint arXiv:1509.02413},
  year   = {2015}
}