基于卷积储备池计算的强化学习
神经与进化计算
2019-12-10 v1 机器学习
摘要
近年来,强化学习模型取得了巨大成功,掌握了围棋及其他得分高于人类玩家的复杂任务。许多此类模型在任务上存储大量数据,并分别使用卷积神经网络(CNN)和循环神经网络提取视觉与时序特征以实现高性能。然而,这些网络的计算成本非常高,因为它们需要通过反复使用存储的数据进行训练。在本研究中,我们提出一种新颖的实用方法,称为基于卷积储备池计算的强化学习(RCRC)模型。RCRC模型使用固定的随机权重CNN和储备池计算模型来提取视觉与时序特征。利用这些提取的特征,它通过进化策略方法决定动作。因此,RCRC模型具有若干理想特性:(1)无需训练特征提取器,(2)无需存储训练数据,(3)可采取广泛的动作,(4)仅有一个依赖于任务的权重参数需要训练。此外,我们展示了RCRC模型可使用完全相同的特征提取器解决多个强化学习任务。
引用
@article{arxiv.1912.04161,
title = {Reinforcement Learning with Convolutional Reservoir Computing},
author = {Hanten Chang and Katsuya Futagami},
journal= {arXiv preprint arXiv:1912.04161},
year = {2019}
}
备注
arXiv admin note: substantial text overlap with arXiv:1907.08040