用于分布强化学习的高效探索非减分位函数网络
机器学习
2021-05-17 v1 人工智能
摘要
尽管分布强化学习(DRL)在过去几年中已被广泛研究,但人们仍在试图解决两个开放问题。一是如何确保所学分位函数的有效性,二是如何高效利用分布信息。本文试图提供一些新视角以鼓励未来在这两个领域的深入研究。我们首先提出一种非减分位函数网络(NDQFN)以保证所得分位估计的单调性,然后设计了一个称为分布预测误差(DPE)的通用探索框架用于 DRL,其利用了分位函数的整个分布。在本文中,我们不仅讨论了方法的理论必要性,还通过在 Atari 2600 游戏上尤其是一些难探索游戏与若干竞争方法的比较展示了其在实践中获得的性能提升。
引用
@article{arxiv.2105.06696,
title = {Non-decreasing Quantile Function Network with Efficient Exploration for Distributional Reinforcement Learning},
author = {Fan Zhou and Zhoufan Zhu and Qi Kuang and Liwen Zhang},
journal= {arXiv preprint arXiv:2105.06696},
year = {2021}
}