中文

用于强化学习的齐夫分布环境

机器学习 2022-08-09 v2

摘要

当人类和动物在自然界中学习时,他们遇到的实体、情境和事件的分布远非均匀。通常,相对较少的经验被频繁遇到,而许多重要经验却很少出现。现实的高度偏斜、重尾特性带来了特殊的学习挑战,人类和动物通过进化出专门的记忆系统来应对。相比之下,大多数流行的强化学习(RL)环境和基准涉及属性、物体、情境或任务的大致均匀变化。RL 算法在环境特征分布远不均匀的世界(如我们的世界)中表现如何?为探究此问题,我们开发了三个互补的 RL 环境,其中智能体的经验按齐夫(Zipfian,离散幂律)分布变化。在这些基准上,我们发现标准深度强化学习(Deep RL)架构与算法能获取关于常见情境和任务的有用知识,却无法充分学习较罕见的内容。为更好地理解这一失败,我们探究如何调整当前方法的各个方面以帮助提升在罕见事件上的表现,并表明 RL 目标函数、智能体的记忆系统以及自监督学习目标均会影响智能体从非寻常经验中学习的能力。综上,这些结果表明,从偏斜经验中稳健学习是将深度 RL 方法应用于模拟或实验室之外场景的关键挑战,而我们开发的齐夫分布环境为衡量朝此目标的未来进展提供了基础。

关键词

引用

@article{arxiv.2203.08222,
  title  = {Zipfian environments for Reinforcement Learning},
  author = {Stephanie C. Y. Chan and Andrew K. Lampinen and Pierre H. Richemond and Felix Hill},
  journal= {arXiv preprint arXiv:2203.08222},
  year   = {2022}
}