中文

关系域中的拟合 Q 学习

机器学习 2020-06-11 v1 人工智能

摘要

我们考虑关系域中的近似动态规划问题。受拟合 Q 学习方法在命题设定下成功的启发,我们通过表示值函数与 Bellman 残差,开发了首个关系拟合 Q 学习算法。当我们拟合 Q 函数时,我们展示了如何使用梯度提升技术执行 Bellman 算子的两步,即应用步与投影步。我们提出的框架在标准域上表现相当良好,且无需使用域模型并使用了更少的训练轨迹。

关键词

引用

@article{arxiv.2006.05595,
  title  = {Fitted Q-Learning for Relational Domains},
  author = {Srijita Das and Sriraam Natarajan and Kaushik Roy and Ronald Parr and Kristian Kersting},
  journal= {arXiv preprint arXiv:2006.05595},
  year   = {2020}
}

备注

10 pages, 12 figures