强化学习中用于探索的离线度量表现如何?
机器学习
2020-10-30 v1
摘要
充分的探索对于强化学习智能体的成功至关重要。然而,探索很少以与算法无关的方式进行评估。我们比较了文献中描述的三种基于数据、离线的探索度量在直观简单分布上的表现,并强调了使用它们时需要注意的问题。我们提出了第四种度量,即均匀相对熵(uniform relative entropy),并使用 k 近邻或最近邻比率估计器来实现它,指出实现方式的选择对这些度量有深远影响。
引用
@article{arxiv.2010.15533,
title = {How do Offline Measures for Exploration in Reinforcement Learning behave?},
author = {Jakob J. Hollenstein and Sayantan Auddy and Matteo Saveriano and Erwan Renaudo and Justus Piater},
journal= {arXiv preprint arXiv:2010.15533},
year = {2020}
}
备注
KBRL Workshop at IJCAI-PRICAI 2020, Yokohama, Japan