中文

解耦价值与策略以提升强化学习泛化能力

机器学习 2021-06-16 v2 人工智能

摘要

标准的深度强化学习算法对策略和价值函数使用共享表征,尤其是在直接从图像训练时。然而,我们认为准确估计价值函数所需的信息多于学习最优策略所需的信息。因此,对策略和价值函数使用共享表征可能导致过拟合。为缓解此问题,我们提出两种方法并将其结合以创建 IDAAC:不变解耦优势 actor-critic(Invariant Decoupled Advantage Actor-Critic)。首先,IDAAC 解耦策略和价值函数的优化,使用独立网络对二者建模。其次,它引入一个辅助损失,鼓励表征对环境中的任务无关属性保持不变。IDAAC 在未见过的环境中表现出良好的泛化能力,在 Procgen 基准上取得了新的最优性能(state-of-the-art),并在带有干扰项的 DeepMind Control 任务上优于流行方法。我们的实现可在 https://github.com/rraileanu/idaac 获取。

关键词

引用

@article{arxiv.2102.10330,
  title  = {Decoupling Value and Policy for Generalization in Reinforcement Learning},
  author = {Roberta Raileanu and Rob Fergus},
  journal= {arXiv preprint arXiv:2102.10330},
  year   = {2021}
}