中文

生态强化学习

机器学习 2020-06-23 v1 人工智能 机器学习

摘要

当前许多强化学习研究着眼于情景式设定,其中智能体在试验间被重置到初始状态分布,且常配有良好塑形的奖励函数。非情景式设定中,智能体必须通过无重置的与世界持续交互来学习,且仅接收到延迟而稀疏的奖励信号,其难度显著更高,但鉴于真实世界环境不会为学习者提供方便的“重置机制”与简易奖励塑形,该设定可谓更现实。在本文中,我们不去研究可应对此类非情景式与稀疏奖励设定的算法改进,而是研究能使此类条件下学习变易的环境性质。理解环境性质如何影响强化学习智能体表现,可助我们以令学习可行的方式构建任务。我们首先讨论所谓“环境塑形”——对环境的修改,提供了奖励塑形的替代方案,且可能更易实现。继而讨论一个更简单的性质,我们称之为“动态性”,描述环境独立于智能体动作而变化之程度,可由环境转移熵度量。令人惊讶的是,我们发现即便此性质亦能大幅缓解非情景式 RL 在稀疏奖励设定下的挑战。我们在一组聚焦于稀疏奖励非情景式学习的新任务上提供了实证评估。通过本研究,我们希望将社区焦点转向分析环境性质如何影响学习及最终经 RL 习得的行为类型。

关键词

引用

@article{arxiv.2006.12478,
  title  = {Ecological Reinforcement Learning},
  author = {John D. Co-Reyes and Suvansh Sanjeev and Glen Berseth and Abhishek Gupta and Sergey Levine},
  journal= {arXiv preprint arXiv:2006.12478},
  year   = {2020}
}

备注

Preprint. Website at: https://sites.google.com/view/ecological-rl/home