中文

基于线性函数逼近的分布强化学习

机器学习 2019-02-11 v1 机器学习

摘要

尽管已有许多算法进展,我们对实用分布强化学习方法的理论理解仍然有限。一个例外是 Rowland 等人(2018)从 Cramér 距离角度对 C51 算法的分析,但他们的结果仅适用于表格情形,且忽略了 C51 使用 softmax 来生成归一化分布。本文中我们改造 Cramér 距离以处理任意向量。由此推导出一种全新的、完全基于 Cramér 的分布算法,该算法可与线性函数逼近相结合,并在策略评估背景下具有形式化保证。通过允许模型的预测为任意实向量,我们失去了该方法背后的概率解释,但在其他方面保留了分布方法令人满意的性质。据我们所知,我们的工作是首个证明分布算法与函数逼近相结合收敛性的结果。或许令人惊讶的是,我们的结果提供了证据表明基于 Cramér 的分布方法可能比直接逼近值函数表现更差。

关键词

引用

@article{arxiv.1902.03149,
  title  = {Distributional reinforcement learning with linear function approximation},
  author = {Marc G. Bellemare and Nicolas Le Roux and Pablo Samuel Castro and Subhodeep Moitra},
  journal= {arXiv preprint arXiv:1902.03149},
  year   = {2019}
}

备注

To appear