一种用于Webots无人值守容器化(深度)强化学习的架构
机器人学
2024-03-05 v1 人工智能
机器学习
摘要
随着数据科学应用在各行各业中的普及,相关工具链日趋成熟,以促进此类应用的生命周期管理,并为应对其中的挑战提供解决方案,从而提高从业人员的生产力。在三维世界中基于智能体的强化学习仍面临挑战:使用仿真软件所需的知识,以及在无人值守训练流程中利用独立仿真软件的问题。本文回顾了针对机器人Robotino在三维世界中训练强化学习智能体的工具和方法,并指出仿真环境(面向虚拟世界创建者)与模型开发环境(面向数据科学家)的分离是一个尚未得到充分讨论的话题。通常两者是同一环境,数据科学家需要了解仿真软件才能直接使用其API。此外,有时虚拟世界创建者和数据科学家甚至在同一文件上工作。我们希望通过描述一种数据科学家无需了解仿真软件的方法来为该话题做出贡献。我们的方法使用独立仿真软件Webots、机器人操作系统(ROS)与仿真机器人及仿真软件本身通信,并利用容器技术将仿真环境与模型开发环境分离。我们重点介绍了数据科学家使用的API,以及在无人值守训练流程中使用独立仿真软件的方法。我们展示了与Robotino及机器人学习任务相关的特定部分。
引用
@article{arxiv.2403.00765,
title = {An Architecture for Unattended Containerized (Deep) Reinforcement Learning with Webots},
author = {Tobias Haubold and Petra Linke},
journal= {arXiv preprint arXiv:2403.00765},
year = {2024}
}
备注
Latex with llncs.cls, 17 pages, 5 figures