中文

基于奖励塑形的深度强化学习在机器人导航中的泛化能力

机器人学 2025-06-17 v2 机器学习

摘要

在本文中,我们研究了深度强化学习(DRL)算法在局部导航问题中的应用,其中机器人仅配备有限量程的外部感知传感器(如 LiDAR),在未知且杂乱的工作空间中移动至目标位置。基于 DRL 的避碰策略具有一定优势,但极易陷入局部极小,因为其学习合适动作的能力受限于传感器量程。由于大多数机器人在非结构化环境中执行任务,寻求能够避免局部极小、尤其在未训练场景中具有泛化能力的局部导航策略具有重要意义。为此,我们提出了一种新颖的奖励函数,其融入了训练阶段获得的地图信息,增强了智能体对最佳行动路线的决策能力。此外,我们使用 SAC 算法训练我们的神经网络(ANN),其在现有文献中表现出优于其他算法的有效性。一组 sim-to-sim 与 sim-to-real 实验表明,我们所提出的奖励函数结合 SAC 在局部极小规避与碰撞避免方面优于对比方法。

关键词

引用

@article{arxiv.2209.14271,
  title  = {Generalization in Deep Reinforcement Learning for Robotic Navigation by Reward Shaping},
  author = {Victor R. F. Miranda and Armando A. Neto and Gustavo M. Freitas and Leonardo A. Mozelli},
  journal= {arXiv preprint arXiv:2209.14271},
  year   = {2025}
}

备注

IEEE Transactions on Industrial Electronics (2023)