用六个神经元玩 Atari 游戏
机器学习
2019-03-05 v2 人工智能
神经与进化计算
机器学习
摘要
深度强化学习应用于基于视觉的问题(如 Atari 游戏)时,将像素直接映射到动作;在内部,深度神经网络承担着提取有用信息并据此做出决策的责任。通过将图像处理与决策分离,可以更好地理解每项任务的复杂性,并有可能找到更小、更易于人类理解且可能泛化更好的策略表示。为此,我们提出一种新方法,在强化学习中分别但同时学习策略与紧凑状态表示以进行策略近似。状态表示由基于两种新算法的编码器生成:递增字典向量量化使编码器能够随时间增长其字典大小,以在开放式在线学习语境中处理新出现的观测;直接残差稀疏编码通过忽略重构误差最小化、转而追求最高信息包含来编码观测。编码器在线自主选择观测进行训练,以最大化编码稀疏性。随着字典大小增加,编码器为神经网络产生越来越大的输入:这通过指数自然进化策略算法的一种变体来解决,该变体在运行过程中自适应其概率分布维度。我们在若干 Atari 游戏上测试了我们的系统,使用仅含 6 到 18 个神经元(取决于游戏的控制方式)的微小神经网络。这些网络仍能达到与使用多两个数量级神经元的最先进(SOTA)技术相当、且偶尔更优的结果。
引用
@article{arxiv.1806.01363,
title = {Playing Atari with Six Neurons},
author = {Giuseppe Cuccu and Julian Togelius and Philippe Cudre-Mauroux},
journal= {arXiv preprint arXiv:1806.01363},
year = {2019}
}
备注
Accepted at AAMAS 2019