基于课程驱动的持续DQN扩展缓解自适应列车调度中的稳定性-可塑性困境
机器学习
2025-03-06 v2 神经与进化计算
摘要
持续学习智能体通过利用先前经验来发展日益复杂的行为,在适应非平稳和动态环境的同时保留已习得的知识。然而,扩展这些系统面临重大挑战,尤其是在平衡先前策略的保留与新策略对当前环境的适应方面。这种平衡被称为稳定性-可塑性困境,在列车调度等复杂多智能体领域中尤为突出,因为环境与智能体行为不断变化,且搜索空间极为庞大。本工作中,我们提出利用课程学习来解决列车调度问题中的这些挑战。我们设计了一组相邻技能相互构建的课程以提升泛化性能。引入具有不同任务的课程会引入非平稳性,我们通过提出一种新算法——持续深度Q网络扩展(Continual DQN Expansion, CDE)来应对该问题。我们的方法通过动态生成和调整Q函数子空间来处理环境变化和任务需求。CDE通过弹性权重巩固(EWC)缓解灾难性遗忘,同时利用自适应有理激活函数确保高可塑性。实验结果表明,与强化学习基线及其他持续学习方法相比,本方法在学习效率和适应性方面均有显著提升,展示了其在管理自适应列车调度中稳定性-可塑性困境方面的潜力。
引用
@article{arxiv.2408.09838,
title = {Mitigating the Stability-Plasticity Dilemma in Adaptive Train Scheduling with Curriculum-Driven Continual DQN Expansion},
author = {Achref Jaziri and Etienne Künzel and Visvanathan Ramesh},
journal= {arXiv preprint arXiv:2408.09838},
year = {2025}
}
备注
9 Pages, 2 Figures