中文

用于世界模型的卷积储备池计算

机器学习 2019-07-19 v1 神经与进化计算 机器学习

摘要

近年来,强化学习模型取得了巨大成功,完成了诸如精通围棋及其他游戏且得分超越人类玩家等复杂任务。其中许多模型在任务上收集大量数据,并分别利用卷积神经网络(CNN)和循环神经网络提取视觉与时序特征以提升准确率。然而,这些网络的计算成本非常高,因为它们需要使用大量历史对局数据反复训练。在本研究中,我们提出了一种新颖的实用方法,称为基于卷积储备池计算的强化学习(RCRC)模型。RCRC 模型具有若干理想特性:1. 它能非常快速地提取视觉与时序特征,因为它使用了随机固定权重的 CNN 和储备池计算模型;2. 它不需要存储训练数据,因为它无需训练即可提取特征,并利用进化策略决定动作。此外,该模型在流行的强化学习任务中达到了 SOTA 分数。令人惊讶的是,我们发现像仅含一个全连接层的网络这样的随机权重固定简单网络也能在该强化学习任务中取得高分。

关键词

引用

@article{arxiv.1907.08040,
  title  = {Convolutional Reservoir Computing for World Models},
  author = {Hanten Chang and Katsuya Futagami},
  journal= {arXiv preprint arXiv:1907.08040},
  year   = {2019}
}