Blue River Controls:面向硬件上强化学习控制系统的工具包
系统与控制
2020-01-09 v1 机器学习
系统与控制
摘要
我们围绕 Quanser 的硬件在环软件开发套件(HIL SDK)提供了一个简单的硬件封装,以便于新 Quanser 硬件的开发。为连接硬件,我们使用了一个用 Cython 编写的模块。内部的 QuanserWrapper 类处理了与硬件交互的大部分困难环节,包括时序(使用硬件定时器),以及确保发送至硬件的数据安全且正确,其中安全性对应于指定硬件的安全工作电压和电流。近期强化学习(RL)的许多成功得益于 OpenAI Gym 和 Deepmind Control Suite 等训练与测试工具。遗憾的是,用于将高频 RL 算法从仿真快速测试并迁移至真实硬件环境的工具基本缺失。我们提出 Blue River Controls,一个允许在真实世界硬件上训练和测试强化学习算法的工具。它具有基于 OpenAI Gym 的简单接口,可直接在仿真和硬件上工作。我们使用 Quanser 的 Qube Servo2-USB 平台——一个欠驱动旋转摆——作为初始测试设备。我们还提供工具以简化在其他硬件上训练 RL 算法。包含了来自经典控制器与预训练 RL 智能体的若干基线,以比较跨任务性能。Blue River Controls 可在此 https URL 获取:https://github.com/BlueRiverTech/quanser-openai-driver
引用
@article{arxiv.2001.02254,
title = {Blue River Controls: A toolkit for Reinforcement Learning Control Systems on Hardware},
author = {Kirill Polzounov and Ramitha Sundar and Lee Redden},
journal= {arXiv preprint arXiv:2001.02254},
year = {2020}
}