神经网络驱动的奖励预测作为启发式:推进移动机器人路径规划中的Q-Learning
机器人学
2024-12-18 v1 人工智能
机器学习
摘要
Q-Learning 是一种广泛用于解决路径规划问题的强化学习技术。它主要涉及智能体与其环境之间的交互,使智能体能够学习最大化累积奖励的最优策略。尽管许多研究报告了 Q-Learning 的有效性,但在实际应用中它仍然面临收敛缓慢的问题。为了解决这个问题,我们提出了 NDR-QL 方法,该方法利用神经网络输出作为启发式信息来加速 Q-Learning 的收敛过程。具体来说,我们通过引入起止通道分离机制并增强特征融合过程,改进了双输出神经网络模型。训练后,所提出的 NDR 模型可以输出一个窄聚焦的最优概率分布(称为 guideline)和一个宽分布的次优分布(称为 region)。随后,基于 guideline 预测,我们计算 Q-Learning 方法的连续奖励函数,并基于 region 预测,我们以偏置初始化 Q-table。我们在公共数据集上进行了训练、验证和路径规划仿真实验。结果表明,NDR 模型在预测精度上比以前的方法高出5%。此外,所提出的 NDR-QL 方法将基线 Q-Learning 方法的收敛速度提高了90%,并且在路径质量指标上也超越了以前改进的 Q-Learning 方法。
关键词
引用
@article{arxiv.2412.12650,
title = {Neural-Network-Driven Reward Prediction as a Heuristic: Advancing Q-Learning for Mobile Robot Path Planning},
author = {Yiming Ji and Kaijie Yun and Yang Liu and Zongwu Xie and Hong Liu},
journal= {arXiv preprint arXiv:2412.12650},
year = {2024}
}