中文

深度好奇搜索:生命周期内探索可提升困难深度强化学习问题表现

人工智能 2018-11-27 v3

摘要

强化学习中的传统探索方法要求智能体执行随机动作以发现奖励。但这类方法在如Montezuma's Revenge等稀疏奖励领域表现不佳,因为任意随机动作序列导向奖励的概率极低。近期算法通过鼓励智能体访问新状态或执行相对于所有先前训练回合的新动作(我们称之为跨训练新颖性)而在此类任务上表现良好。但这类算法未考虑智能体是否展现生命周期内新颖性:在当前回合内做新事情,无论这些行为在先前回合中是否出现过。我们假设跨训练新颖性可能阻碍智能体重访初始无奖励、但在训练后期可能成为重要踏脚石的状态。我们提出深度好奇搜索(DeepCS),通过奖励智能体在每个回合内访问尽可能多不同状态来鼓励生命周期内探索,并展示DeepCS在Montezuma's Revenge上匹配当前最优方法表现。我们进一步展示DeepCS在Amidar、Freeway、Gravitar和Tutankham(多为困难探索游戏)上改善探索。令人惊讶的是,DeepCS使A2C在Seaquest上的表现翻倍,而该游戏我们本不预期会从生命周期内探索受益,因其竞技场狭小且易被朴素探索技术导航。在一次运行中,DeepCS在Seaquest上取得80,000点的最高训练分,高于除Ape-X外任何方法。DeepCS在这些稀疏与稠密奖励任务上的强劲表现表明,鼓励生命周期内新颖性是改进深度RL表现的一种有趣新方法,并激励进一步研究跨训练与生命周期内探索方法的混合。

关键词

引用

@article{arxiv.1806.00553,
  title  = {Deep Curiosity Search: Intra-Life Exploration Can Improve Performance on Challenging Deep Reinforcement Learning Problems},
  author = {Christopher Stanton and Jeff Clune},
  journal= {arXiv preprint arXiv:1806.00553},
  year   = {2018}
}