中文

一种紧凑的分层 Q 函数分解

机器学习 2012-07-02 v1 人工智能 机器学习

摘要

先前在分层强化学习中的工作面临一个困境:要么忽略子程序不同可能退出状态的值,从而可能导致次优行为;要么显式地表示这些值,从而可能产生较大的表示代价,因为退出值涉及世界的非局部方面(即所有后续奖励)。本文表明,在许多情况下,可以同时避免这两个问题。该解决方案基于在层级的更高层次上根据 Q 函数递归地分解退出值函数。这产生了一种直观上吸引人的运行时架构,其中父子程序向其子程序传递一个关于退出状态的值函数,而子程序推理其选择如何影响退出值。我们还确定了值函数和转移分布上的结构条件,这些条件允许对退出状态分布进行更简洁的表示,从而实现进一步的状态抽象。本质上,唯一需要考虑其退出值的变量是父级关心且子级影响的变量。我们在一系列日益复杂的环境中展示了我们算法的实用性。

关键词

引用

@article{arxiv.1206.6851,
  title  = {A compact, hierarchical Q-function decomposition},
  author = {Bhaskara Marthi and Stuart Russell and David Andre},
  journal= {arXiv preprint arXiv:1206.6851},
  year   = {2012}
}

备注

Appears in Proceedings of the Twenty-Second Conference on Uncertainty in Artificial Intelligence (UAI2006)