以乐观模拟探索作为真实探索的激励
机器学习
2009-05-20 v3 人工智能
摘要
许多强化学习探索技术过于乐观,并试图探索每一个状态。在具有无限数量状态的环境中,这种探索是不可能的。我提议使用带有乐观模型的模拟探索,为真实探索发现有希望的路径。这减少了对真实探索的需求。
引用
@article{arxiv.0903.2972,
title = {Optimistic Simulated Exploration as an Incentive for Real Exploration},
author = {Ivo Danihelka},
journal= {arXiv preprint arXiv:0903.2972},
year = {2009}
}
备注
accepted, noted that the initial path was 217 steps long