提升基于 Q-Learning 的真实世界控制:基于系列混合农业拖拉机的案例研究
系统与控制
2025-08-06 v1 系统与控制
摘要
混合式农业拖拉机的可变且不可预测的负载需求使得设计最优的基于规则的能源管理策略变得困难,这促使使用自适应、基于学习的控制。然而,现有方法通常依赖基本的基于燃油的奖励,未充分利用专家演示来加速训练。在本文中,首先评估了 Q 值基于强化学习算法在混合农业拖拉机电力系统控制中的性能。比较了三种算法:Double Q-Learning (DQL)、Deep Q-Networks (DQN) 和 Double DQN (DDQN),从收敛速度和策略最优性三个方面进行比较。其次,引入分段领域特定的奖励塑形策略,以提高学习效率并引导智能体行为朝向发动机燃油高效运行区域。最后,检查经验回放缓冲区的设计,重点关注使用专家演示种植缓冲区的效果,以及不同类型的专家策略如何影响收敛动力学和最终性能。实验结果表明:(1) DDQN 在该应用领域的收敛速度比 DQN 快 70%;(2) 提议的奖励塑形方法有效地将学习到的策略偏向于燃油高效的结果;(3) 使用结构化专家数据初始化回放缓冲区可实现收敛速度提升 33%。
引用
@article{arxiv.2508.03647,
title = {Improving Q-Learning for Real-World Control: A Case Study in Series Hybrid Agricultural Tractors},
author = {Hend Abououf and Sidra Ghayour Bhatti and Qadeer Ahmed},
journal= {arXiv preprint arXiv:2508.03647},
year = {2025}
}