中文

一次学习,任意规划 (LOPA):面向全局路径规划的注意力增强深度强化学习方法

机器学习 2024-01-10 v1 人工智能 机器人学

摘要

深度强化学习 (DRL) 方法近期在路径规划任务中展现出潜力。然而,在处理全局规划任务时,这些方法面临收敛性差和泛化能力弱等严峻挑战。为此,本文提出了一种名为 LOPA(一次学习,任意规划)的注意力增强 DRL 方法。首先,我们从 DRL 观测的角度分析了这些问题的成因,揭示了传统设计导致 DRL 受到无关地图信息干扰。其次,我们开发了 LOPA,它利用一种新颖的注意力增强机制,提升了对观测中关键信息的注意力能力。该机制通过两个步骤实现:(1) 构建一个注意力模型,将 DRL 的观测转化为局部和全局两个动态视图,显著引导 LOPA 聚焦于给定地图上的关键信息;(2) 构建一个双通道网络来处理这两个视图并将其整合,以获得更强的推理能力。通过多目标全局路径规划实验对 LOPA 进行了验证。结果表明,LOPA 具有更好的收敛性和泛化性能,以及很高的路径规划效率。

关键词

引用

@article{arxiv.2401.04145,
  title  = {Learn Once Plan Arbitrarily (LOPA): Attention-Enhanced Deep Reinforcement Learning Method for Global Path Planning},
  author = {Guoming Huang and Mingxin Hou and Xiaofang Yuan and Shuqiao Huang and Yaonan Wang},
  journal= {arXiv preprint arXiv:2401.04145},
  year   = {2024}
}