中文

开放问题:无记忆策略类中的 POMDP 近似规划

人工智能 2016-08-18 v1

摘要

规划在广泛的决策理论类中起着重要作用。规划在机器人与序列决策领域近期工作中备受关注。近来,强化学习(RL)作为一个智能体-环境交互问题,进一步引起了对规划方法的关注。通常在 RL 中,可以假设一个生成模型,例如图模型,用于环境,然后 RL 智能体的任务是学习模型参数并基于这些学习到的参数找到最优策略。基于环境行为,智能体可以假设各类生成模型,例如用于静态环境的多臂老虎机,或用于动态环境的马尔可夫决策过程(MDP)。这些流行模型的优势在于其简单性,从而产生了学习参数与寻找最优策略的易处理方法。这些模型的缺点也在于其简单性:这些模型通常欠拟合且低估实际环境行为。例如,在机器人学中,智能体通常对环境内部状态有噪声观测,而 MDP 并非合适的模型。更复杂的模型如部分可观测马尔可夫决策过程(POMDP)可补偿此缺点。将该模型拟合于环境,其中部分观测被给予智能体,相较于 MDP 通常带来显著的性能提升,有时是无界提升。一般而言,为 POMDP 模型寻找最优策略在计算上是难处理的且完全非凸的,即便对于无记忆策略类也是如此。该开放问题是要提出一种方法,为 POMDP 模型找到精确的或近似的最优随机无记忆策略。

关键词

引用

@article{arxiv.1608.04996,
  title  = {Open Problem: Approximate Planning of POMDPs in the class of Memoryless Policies},
  author = {Kamyar Azizzadenesheli and Alessandro Lazaric and Animashree Anandkumar},
  journal= {arXiv preprint arXiv:1608.04996},
  year   = {2016}
}

备注

arXiv admin note: substantial text overlap with arXiv:1602.07764