中文

通过部分解耦强化学习与向量化多样性在一小时内训练真实世界局部路径规划器

人工智能 2024-12-06 v3 机器人学

摘要

深度强化学习(DRL)在解决局部路径规划(LPP)问题中已展现出有效性。然而,由于 DRL 训练效率与泛化能力的不足,此类应用在真实世界中受到极大限制。为缓解这两个问题,本文提出名为 Color 的解决方案,其由 Actor-Sharer-Learner(ASL)训练框架与面向移动机器人的仿真器 Sparrow 组成。具体而言,ASL 旨在提升 DRL 算法的训练效率:它采用向量化数据采集(VDC)模式加速数据获取,通过多线程将数据采集与模型优化解耦,并利用时间反馈机制(TFM)将两过程部分连接以避免数据欠用或过度使用。同时,Sparrow 仿真器利用基于 2D 网格的世界、简化运动学与无转换数据流实现轻量化设计。该轻量性有助于向量化多样性,允许在大量向量化环境副本上设置多样化仿真,从而显著提升所训练 DRL 算法的泛化能力。我们开展了涵盖 57 个 DRL 基准环境、32 个仿真与 36 个真实世界 LPP 场景的综合实验,以验证本方法在效率与泛化方面的优越性。本文代码与视频见 https://github.com/XinJingHao/Color。

关键词

引用

@article{arxiv.2305.04180,
  title  = {Train a Real-world Local Path Planner in One Hour via Partially Decoupled Reinforcement Learning and Vectorized Diversity},
  author = {Jinghao Xin and Jinwoo Kim and Zhi Li and Ning Li},
  journal= {arXiv preprint arXiv:2305.04180},
  year   = {2024}
}

备注

36 pages