基于通用值函数的随机好奇心探索
机器学习
2022-11-21 v1
摘要
强化学习中的高效探索是一个具有挑战性的问题,通常通过内在奖励来解决。近期显著的方法基于状态新颖性或人工好奇心的变体。然而,将它们直接应用于部分可观测环境可能效率低下,并导致内在奖励过早消散。在此我们提出随机好奇心与通用值函数(RC-GVF),一种新颖的内在奖励函数,它借鉴了这些不同方法之间的联系。RC-GVF 并非仅使用当前观测的新颖性或因未能预测精确环境动态而给予的好奇心奖励,而是通过预测时间扩展的通用值函数来导出内在奖励。我们证明这改善了一个困难探索的诡锁问题中的探索。此外,在部分可观测的 MiniGrid 环境中无 ground-truth 回合计数时,RC-GVF 显著优于先前方法。MiniGrid 上的全景观测进一步提升了 RC-GVF 的性能,使其与利用回合计数形式特权信息的基线具有竞争力。
引用
@article{arxiv.2211.10282,
title = {Exploring through Random Curiosity with General Value Functions},
author = {Aditya Ramesh and Louis Kirsch and Sjoerd van Steenkiste and Jürgen Schmidhuber},
journal= {arXiv preprint arXiv:2211.10282},
year = {2022}
}
备注
Accepted to NeurIPS 2022