面向动态环境中自主导航的混合 DQN-TD3 强化学习
机器人学
2025-10-31 v1 人工智能
机器学习
摘要
本文提出一种分层路径规划与控制框架,将高层深度 Q 网络(DQN)用于离散子目标选择,与低层 Twin Delayed Deep Deterministic Policy Gradient(TD3)控制器用于连续驱动。高层模块选择行为和子目标;低层模块执行平滑速度命令。我们设计了实用的奖励塑造方案(方向、距离、障碍物规避、动作平滑性、碰撞惩罚、时间惩罚和进度),并配备基于激光雷达的安全门以防止不安全运动。系统在 ROS + Gazebo(TurtleBot3)中实现,并使用 PathBench 指标评估,包括成功率、碰撞率、路径效率和重规划效率,在动态和部分可观测环境中进行实验。实验结果表明,与单算法基线(仅 DQN 或 TD3)以及基于规则的规划器相比,本方法在成功率和样本效率方面均有所提升,同时对未见障碍物配置具有更好的泛化能力,并显著减少突发控制变化。代码和评估脚本均可在项目仓库中获取。
引用
@article{arxiv.2510.26646,
title = {Hybrid DQN-TD3 Reinforcement Learning for Autonomous Navigation in Dynamic Environments},
author = {Xiaoyi He and Danggui Chen and Zhenshuo Zhang and Zimeng Bai},
journal= {arXiv preprint arXiv:2510.26646},
year = {2025}
}
备注
6 pages, 5 figures; ROS+Gazebo (TurtleBot3) implementation; evaluation with PathBench metrics; code (primary): https://github.com/MayaCHEN-github/HierarchicalRL-robot-navigation; mirror (for reproducibility): https://github.com/ShowyHe/DRL-robot-navigation