中文

基于模型的转码器网络深度强化学习正则化

机器学习 2018-11-21 v2 机器学习

摘要

本文提出了一种用于基于价值的深度强化学习的新优化目标。我们通过添加模型学习组件来扩展传统的 Deep Q-Networks (DQNs),从而得到转码器网络。模型的预测误差作为附加正则化项被包含在基本的 DQN 损失中。这一增广目标带来了更丰富的训练信号,在每个时间步都提供反馈。此外,由于学习环境模型与 RL 问题共享一种共同结构,我们假设所得目标同时提升了样本效率和性能。我们在 Atari 基准的 20 个游戏范围内实证确认了我们的假设,取得了优于不带基于模型正则化的原始 DQN 的结果。

关键词

引用

@article{arxiv.1809.01906,
  title  = {Model-Based Regularization for Deep Reinforcement Learning with Transcoder Networks},
  author = {Felix Leibfried and Peter Vrancx},
  journal= {arXiv preprint arXiv:1809.01906},
  year   = {2018}
}

备注

Presented at the NIPS Deep Reinforcement Learning Workshop, Montreal, Canada, 2018