通过最小化覆盖时间发现用于探索的选项
人工智能
2019-03-19 v2
摘要
强化学习的主要挑战之一是解决稀疏奖励任务。我们表明,在 MDP 中发现遥远奖励状态的难度受限于由 MDP 转移动态所诱导图上随机游走的期望覆盖时间。因此我们提议通过构造最小化覆盖时间的选项来加速探索。所提算法找到一个选项,可证明地减少均匀随机游走访问状态空间中每个状态所需的期望步数。我们通过实验证明,所提算法在若干稀疏奖励领域中改善了学习时长。
引用
@article{arxiv.1903.00606,
title = {Discovering Options for Exploration by Minimizing Cover Time},
author = {Yuu Jinnai and Jee Won Park and David Abel and George Konidaris},
journal= {arXiv preprint arXiv:1903.00606},
year = {2019}
}