中文

基于启发式度量的深度 Q 网络中衰减探索的重退火

人工智能 2020-10-01 v1

摘要

强化学习(RL)中现有的探索策略往往忽视搜索的历史或反馈,或实现复杂。展示其在多样领域有效性的文献也十分有限。我们提出一种基于重退火思想的算法,旨在仅在需要鼓励探索时才这样做,例如当算法检测到智能体陷入局部最优时。该方法易于实现。我们进行了说明性案例研究,表明其有潜力同时加速训练并获得更好的策略。

关键词

引用

@article{arxiv.2009.14297,
  title  = {Reannealing of Decaying Exploration Based On Heuristic Measure in Deep Q-Network},
  author = {Xing Wang and Alexander Vinel},
  journal= {arXiv preprint arXiv:2009.14297},
  year   = {2020}
}