一种用于 Atari 游戏中联合视频帧与奖励预测的深度学习方法
人工智能
2017-08-18 v2 机器学习
机器学习
摘要
强化学习关注于在初始未知的环境中识别最大化奖励的行为策略。最先进的强化学习方法(如深度 Q 网络)是无模型的,能够在诸如 Atari 游戏等多种环境中有效地学习行动,但需要大量数据。基于模型的技术数据效率更高,但需要获取关于环境的显式知识。在本文中,我们朝着在具有高维视觉状态空间的环境中使用基于模型的技术迈出了一步,证明了联合学习系统动力学和奖励结构是可行的。我们的贡献是将最近开发的用于 Atari 游戏视频帧预测的深度神经网络进行扩展,使其同时具备奖励预测能力。为此,我们提出了一个联合优化问题,以最小化视频帧和奖励重建损失,并相应地调整网络参数。在五款 Atari 游戏上的实证评估表明,在长达 200 帧的范围内实现了准确的累积奖励预测。我们认为这些结果为在复杂、初始未知的环境中进行基于模型的强化学习开辟了重要方向。
引用
@article{arxiv.1611.07078,
title = {A Deep Learning Approach for Joint Video Frame and Reward Prediction in Atari Games},
author = {Felix Leibfried and Nate Kushman and Katja Hofmann},
journal= {arXiv preprint arXiv:1611.07078},
year = {2017}
}
备注
Presented at the ICML 2017 Workshop on Principled Approaches to Deep Learning, Sydney, Australia, 2017