中文

面向自主车辆非线性预测控制的逆强化学习场景动力学学习

机器人学 2025-04-03 v1 机器学习

摘要

本文介绍了基于深度学习的非线性模型预测控制器与场景动力学(DL-NMPC-SD)方法,用于自主导航。DL-NMPC-SD将先验名义车辆模型与从时间距离感知信息中学习的场景动力学模型相结合。场景动力学模型负责估计期望车辆轨迹,并调整底层模型预测控制器所使用的真实系统模型。我们提出将场景动力学模型编码在深度神经网络层内,该网络作为运行条件高阶状态空间的非线性逼近器。该模型基于时间序列的距离感知观测和系统状态进行学习,两者由增强记忆组件集成。我们使用逆强化学习和Bellman最优性原理,通过改进的深度Q学习算法训练我们的学习控制器,从而能够将期望状态轨迹估计为最优动作值函数。我们在GridSim虚拟环境、使用RovisLab AMTU(自主移动测试单元)平台的室内外导航任务以及公共道路上行驶的全尺寸自主测试车辆上,将DL-NMPC-SD与基线动态窗口法(DWA)以及两种最先进的端到端和强化学习方法进行了对比评估。

关键词

引用

@article{arxiv.2504.01336,
  title  = {Inverse RL Scene Dynamics Learning for Nonlinear Predictive Control in Autonomous Vehicles},
  author = {Sorin Grigorescu and Mihai Zaha},
  journal= {arXiv preprint arXiv:2504.01336},
  year   = {2025}
}

备注

21 pages, 14 figures, journal paper