二值化 P 网络:基于 FPGA 的原始图像机器人控制深度强化学习
机器人学
2021-09-16 v2
摘要
本文探索了一种深度强化学习(DRL)方法,用于设计面向边缘机器人的基于图像的控制策略,并在现场可编程门阵列(FPGA)上实现。尽管 FPGA 比 CPU 和 GPU 更节能,但典型的 DRL 方法无法直接应用,因为 FPGA 由大量用于高速逻辑运算但低速实数运算的逻辑块(LB)组成。为解决这一问题,我们提出了一种名为二值化 P 网络(BPN)的新型 DRL 算法,该算法使用二值化卷积神经网络(BCNN)学习图像输入的控制策略。为缓解因 BCNN 函数逼近精度较低而导致的强化学习不稳定性,我们的 BPN 采用了一种鲁棒的值更新方案,称为保守值迭代(Conservative Value Iteration),该方案对函数逼近误差具有容忍性。我们通过在仿真中的视觉跟踪任务以及基于 FPGA 的真实机器人实验,验证了 BPN 的有效性。
引用
@article{arxiv.2109.04966,
title = {Binarized P-Network: Deep Reinforcement Learning of Robot Control from Raw Images on FPGA},
author = {Yuki Kadokawa and Yoshihisa Tsurumine and Takamitsu Matsubara},
journal= {arXiv preprint arXiv:2109.04966},
year = {2021}
}
备注
8 pages, Accepted by Robotics and Automation Letters