中文

一种基于 FPGA 的利用在线序列学习的设备上强化学习方法

机器学习 2023-03-14 v4 机器学习

摘要

DQN(Deep Q-Network,深度Q网络)是一种利用深度神经网络进行强化学习Q学习的方法。DQN需要较大的缓冲区和批量处理以进行经验回放,并依赖基于反向传播的迭代优化,难以在资源受限的边缘设备上实现。本文提出一种面向低成本FPGA设备的轻量级设备上强化学习方法。它利用了最近提出的基于神经网络的设备上学习方法,该方法不依赖反向传播方法,而是使用基于OS-ELM(Online Sequential Extreme Learning Machine,在线序列极限学习机)的训练算法。此外,我们提出了L2正则化与谱归一化的组合用于设备上强化学习,以使神经网络的输出值能拟合到某一范围内,并使强化学习变得稳定。所提出的强化学习方法针对PYNQ-Z1板作为低成本FPGA平台进行设计。使用OpenAI Gym的评估结果表明,当隐藏层节点数为64时,所提算法及其FPGA实现完成CartPole-v0任务的速度分别比传统的基于DQN的方法快29.77倍和89.40倍。

关键词

引用

@article{arxiv.2005.04646,
  title  = {An FPGA-Based On-Device Reinforcement Learning Approach using Online Sequential Learning},
  author = {Hirohisa Watanabe and Mineto Tsukada and Hiroki Matsutani},
  journal= {arXiv preprint arXiv:2005.04646},
  year   = {2023}
}

备注

RAW'21