基于回声状态网络的递归最小二乘策略控制
机器学习
2022-01-14 v1
摘要
回声状态网络(ESN)是一类用于处理时间序列数据的特殊循环神经网络。然而,受限于智能体序列样本间的强相关性,基于 ESN 的策略控制算法难以使用递归最小二乘(RLS)算法更新 ESN 参数。为解决该问题,我们提出两种新颖的策略控制算法:ESNRLS-Q 与 ESNRLS-Sarsa。首先,为降低训练样本相关性,我们采用泄漏积分 ESN 与小批量学习模式。其次,为使 RLS 适用于小批量模式训练 ESN,我们提出一种更新 RLS 相关矩阵的均值近似新方法。第三,为防止 ESN 过拟合,我们采用 L1 正则化技术。最后,为防止目标状态-动作值被高估,我们采用 Mellowmax 方法。仿真结果表明所提算法具有良好的收敛性能。
引用
@article{arxiv.2201.04781,
title = {Recursive Least Squares Policy Control with Echo State Network},
author = {Chunyuan Zhang and Chao Liu and Qi Song and Jie Zhao},
journal= {arXiv preprint arXiv:2201.04781},
year = {2022}
}