时间近视Go-Explore:为Go-Explore范式学习状态表征
机器学习
2023-01-16 v1
摘要
具有稀疏奖励信号的超大规模状态空间难以探索。缺乏复杂的引导导致众多强化学习算法表现不佳。在这些情况下,常用的随机探索往往没有帮助。文献表明,这类环境需要付出巨大努力才能系统地探索状态空间的大块区域。学习到的状态表征可以通过提供语义上下文并在原始观测之上构建结构来帮助改进搜索。在这项工作中,我们引入了一种新颖的时间近视状态表征,它将时间上接近的状态聚类在一起,同时提供它们之间的时间预测能力。通过将此模型适配到Go-Explore范式(Ecoffet et al., 2021b),我们展示了首个能够可靠估计新颖性而非使用手工设计表征启发式方法的学习型状态表征。我们的方法为分离问题提供了一种改进的解决方案,该问题在Go-Explore探索阶段仍然是一个难题。我们提供证据表明,我们提出的方法覆盖了关于所有可能时间轨迹的整个状态空间,而不会在单元存档中引起不利的冲突重叠。与原生Go-Explore类似,我们的方法在困难的探索环境MontezumaRevenge、Gravitar和Frostbite(Atari)上进行了评估,以验证其在困难任务上的能力。我们的实验表明,时间近视Go-Explore是领域工程启发式方法的一种有效替代方案,同时也更具通用性。该方法的源代码可在GitHub上获取。
引用
@article{arxiv.2301.05635,
title = {Time-Myopic Go-Explore: Learning A State Representation for the Go-Explore Paradigm},
author = {Marc Höftmann and Jan Robine and Stefan Harmeling},
journal= {arXiv preprint arXiv:2301.05635},
year = {2023}
}
备注
9 pages, 7 figures, Deep Reinforcement Learning Workshop NeurIPS 2022, Deep RL Workshop 2022 NeurIPS, OpenReview