持久MDP中的长期探索
机器学习
2021-09-22 v1 人工智能
摘要
探索是强化学习的重要组成部分,限制了所学策略的质量。硬探索环境以巨大状态空间与稀疏奖励为特征。在此条件下,对环境的穷尽探索往往不可能,智能体的成功训练需要大量交互步数。本文提出一种称为Rollback-Explore(RbExplore)的探索方法,其利用持久马尔可夫决策过程的概念,即训练中的智能体可回滚至已访问状态。我们在无奖励与领域知识的硬探索游戏《波斯王子》中测试了我们的算法。在游戏所有所用关卡中,我们的智能体优于或展现出与基于知识的内部动机SOTA好奇心方法ICM和RND相当的结果。RbExplore的实现见 https://github.com/cds-mipt/RbExplore。
引用
@article{arxiv.2109.10173,
title = {Long-Term Exploration in Persistent MDPs},
author = {Leonid Ugadiarov and Alexey Skrynnik and Aleksandr I. Panov},
journal= {arXiv preprint arXiv:2109.10173},
year = {2021}
}
备注
This is a preprint of the paper accepted to MICAI 2021. It contains 13 pages and 6 figures