使用 Sim-to-Real 迁移多智能体强化学习自动驾驶策略
机器人学
2022-03-23 v1
摘要
自动驾驶需要智能体之间高水平的协调与协作。在多智能体系统中实现有效协调是一项仍然很大程度上未解决的困难任务。多智能体强化学习已成为完成这一任务的强大方法,因为它考虑了智能体之间的交互,并且允许去中心化训练——这使其具有高度可扩展性。然而,将策略从仿真迁移到真实世界是一个巨大的挑战,即使对于单智能体应用也是如此。由于智能体协作和环境同步,多智能体系统给 Sim-to-Real 差距增加了额外的复杂性。在本文中,我们提出了一种将多智能体自动驾驶策略迁移到真实世界的方法。为此,我们创建了一个模仿 Duckietown 多机器人测试台动力学的多智能体环境,并使用具有不同级别域随机化的 MAPPO 算法训练多智能体策略。然后,我们将训练好的策略迁移到 Duckietown 测试台,并将 MAPPO 算法的使用与传统基于规则的方法进行比较。我们表明,使用 MAPPO 和域随机化迁移的策略的奖励平均是基于规则方法的 1.85 倍。此外,我们表明不同级别的参数随机化对 Sim-to-Real 差距有重大影响。
关键词
引用
@article{arxiv.2203.11653,
title = {Transferring Multi-Agent Reinforcement Learning Policies for Autonomous Driving using Sim-to-Real},
author = {Eduardo Candela and Leandro Parada and Luis Marques and Tiberiu-Andrei Georgescu and Yiannis Demiris and Panagiotis Angeloudis},
journal= {arXiv preprint arXiv:2203.11653},
year = {2022}
}