基于粒子动力学环境与深度强化学习的含障碍房间应急疏散
机器学习
2021-03-09 v1 计算物理
摘要
社会力模型是模拟应急疏散非常成功的模型。该模型的核心是针对智能体并指向出口的自驱动力。然而,尚不清楚该力的应用是否能实现最优疏散,尤其在含障碍的复杂环境中。在此,我们结合社会力模型开发了一种深度强化学习算法,以训练智能体寻找最快疏散路径。训练过程中,我们对智能体在房间内的每一步施加惩罚,并在出口处给予零奖励。我们采用 Dyna-Q 学习方法。我们首先证明,在无障碍房间中,所得自驱动力直接指向出口,与社会力模型一致,且两种方法计算的中位疏散时间间隔无显著差异。接着,我们研究含一个障碍和一个出口的房间疏散。我们发现,当障碍为凸形时,我们的方法与社会力模型结果相似。然而,在凹形障碍情况下,纯社会力模型有时会使智能体陷入陷阱并阻碍房间完全疏散,而我们的方法明显占优,因为它推导出的策略可实现避障并完成房间完全疏散,无需额外假设。我们还研究了含多个出口的房间疏散。我们表明,通过为单智能体训练得到的共享网络,智能体能够从最近出口高效疏散。最后,我们在含多出口与障碍的复杂环境中测试了 Dyna-Q 学习方法的鲁棒性。总体而言,我们表明我们的模型能高效模拟含多出口与障碍复杂环境中的应急疏散,而此类环境中难以获得直观的快速疏散规则。
引用
@article{arxiv.2012.00065,
title = {Deep reinforcement learning with a particle dynamics environment applied to emergency evacuation of a room with obstacles},
author = {Yihao Zhang and Zhaojie Chai and George Lykotrafitis},
journal= {arXiv preprint arXiv:2012.00065},
year = {2021}
}
备注
30 pages, 8 figures, 6 supplemental figures