中文

基于强化学习与PID的六自由度游泳机器人控制器对比:混合水下目标跟踪

机器人学 2024-01-31 v1 人工智能

摘要

在本文中,我们探索并评估了在六自由度(6DOF)游泳机器人背景下,采用集中式深度Q网络(DQN)控制器替代普遍使用的PID控制器的方案。我们的主要焦点集中在以水下目标跟踪这一具体案例来说明这种转变。DQN具有数据高效和离策略学习等优势,同时比其他强化学习方法更易于实现。鉴于我们的机器人缺乏动力学模型,我们提出使用一个强化学习(RL)智能体来控制这个多输入多输出(MIMO)系统,其中集中式控制器可能比分离的PID控制器提供更鲁棒的控制。我们的方法包括最初使用经典控制器进行安全探索,然后逐渐转向DQN以完全控制机器人。我们将水下跟踪任务分为视觉和控制模块。我们使用已建立的方法进行基于视觉的跟踪,并引入一个集中式DQN控制器。通过将边界框数据从视觉模块传输到控制模块,我们能够适应各种物体并无缝替换视觉系统。此外,处理低维数据有助于控制器进行成本效益高的在线学习。我们在基于Unity的模拟器中进行的实验验证了集中式RL智能体相对于分离式PID控制器的有效性,展示了我们框架用于训练水下RL智能体的适用性,以及与传统控制方法相比性能的提升。真实和模拟实现的代码位于https://github.com/FARAZLOTFI/underwater-object-tracking。

关键词

引用

@article{arxiv.2401.16618,
  title  = {A comparison of RL-based and PID controllers for 6-DOF swimming robots: hybrid underwater object tracking},
  author = {Faraz Lotfi and Khalil Virji and Nicholas Dudek and Gregory Dudek},
  journal= {arXiv preprint arXiv:2401.16618},
  year   = {2024}
}