一种新颖的强化学习方法用于提升电梯群控系统的效率
机器学习
2025-07-02 v1 人工智能
摘要
大型建筑中的电梯流量管理对于最小化乘客旅行时间和能源消耗至关重要。由于基于启发式或模式检测的控制器难以应对调度的随机性和组合性,本文将位于 Amsterdam Vrije Universiteit 的六电梯、十五层楼的系统建模为马尔可夫决策过程(MDP),并训练一个端到端的强化学习(RL)电梯群控系统(EGCS)。关键创新包括一种用于处理电梯调度组合复杂性的新颖动作空间编码、引入用于建模连续乘客到达的“infra-steps”(内部步骤),以及为提高学习效率量身定制的奖励信号。此外,我们探讨了various 方法来适应 infra-step 表述下的折扣因子。我们基于 Dueling Double Deep Q-learning 的 RL 架构,表明所提出的 RL 基于 EGCS 能适应波动的交通模式,从高度随机的环境中学习,从而优于传统基于规则的算法。
引用
@article{arxiv.2507.00011,
title = {Novel RL approach for efficient Elevator Group Control Systems},
author = {Nathan Vaartjes and Vincent Francois-Lavet},
journal= {arXiv preprint arXiv:2507.00011},
year = {2025}
}
备注
15 pages, 12 figures