中文

用于连续状态空间 MDP 的近似卡尔曼滤波 Q-Learning

机器学习 2013-09-27 v1 机器学习

摘要

我们旨在通过 Q-Learning 学习具有连续状态的马尔可夫决策过程 (MDP) 的有效策略。给定一组定义在状态 - 动作对上的基函数,我们搜索一组相应的线性权重以最小化平均 Bellman 残差。我们的算法使用卡尔曼滤波模型来估计这些权重,并且我们开发了一种更简单的近似卡尔曼滤波模型,该模型在多个标准基准问题上优于当前最先进的投影 TD-Learning 方法。

关键词

引用

@article{arxiv.1309.6868,
  title  = {Approximate Kalman Filter Q-Learning for Continuous State-Space MDPs},
  author = {Charles Tripp and Ross D. Shachter},
  journal= {arXiv preprint arXiv:1309.6868},
  year   = {2013}
}

备注

Appears in Proceedings of the Twenty-Ninth Conference on Uncertainty in Artificial Intelligence (UAI2013)