基于课程启发式自适应直接策略指导的强化学习用于卡车调度
机器学习
2025-03-03 v1 人工智能
摘要
在露天采矿中,通过强化学习 (RL) 实现高效的卡车调度往往受制于对复杂奖励工程和基于价值方法的依赖。本文提出了一种课程启发式自适应直接策略指导 (Curriculum-inspired Adaptive Direct Policy Guidance),这是一种用于基于策略的 RL 的新型课程学习策略,旨在解决这些问题。我们通过在时间差分和广义优势估计中使用时间增量,使近端策略优化 (PPO) 适应矿山调度中不均匀的决策间隔,并采用最短处理时间教师策略,通过策略正则化和自适应指导进行引导探索。在 OpenMines 中的评估表明,在稀疏和密集奖励设置下,与标准 PPO 相比,我们的方法实现了 10% 的性能提升和更快的收敛速度,展现出对奖励设计更好的鲁棒性。这种直接策略指导方法为基于 RL 的卡车调度提供了一种通用且有效的课程学习技术,为未来在高级架构上的研究提供了可能。
引用
@article{arxiv.2502.20845,
title = {Reinforcement Learning with Curriculum-inspired Adaptive Direct Policy Guidance for Truck Dispatching},
author = {Shi Meng and Bin Tian and Xiaotong Zhang},
journal= {arXiv preprint arXiv:2502.20845},
year = {2025}
}