中文

基于 Q 矩阵迁移学习的深度 Q 学习用于新型火灾疏散环境

人工智能 2019-05-30 v2 机器学习 系统与控制

摘要

我们关注紧急疏散这一重要问题,其显然可从强化学习中受益,但很大程度上尚未被研究。紧急疏散是一项复杂任务,难以用强化学习求解,因为紧急情况高度动态,具有大量变化变量和复杂约束,使其难以训练。本文中,我们提出了首个用于训练强化学习智能体进行疏散规划的火灾疏散环境。该环境被建模为捕捉建筑结构的图,包含火势蔓延、不确定性和瓶颈等真实特征。我们已在 OpenAI gym 格式中实现该环境,以促进未来研究。我们还提出了一种新的强化学习方法,其通过对基于 DQN 的智能体的网络权重进行预训练,以融入通往出口最短路径的信息。我们通过使用表格 Q 学习在建筑模型图上学习最短路径来实现这一点。该信息通过故意在 Q 矩阵上过拟合而迁移到网络中。然后,预训练的 DQN 模型在火灾疏散环境中训练,以在时变条件下生成最优疏散路径。我们将所提方法与 PPO、VPG、SARSA、A2C 和 ACKTR 等最先进强化学习算法进行比较。结果表明,我们的方法能够大幅优于最先进模型,包括原始的基于 DQN 的模型。最后,我们在一个由 91 个房间组成的大型复杂真实建筑上测试我们的模型,该建筑可移动到任何其他房间,因此具有 8281 个动作。我们使用基于注意力的机制来处理大动作空间。我们的模型在真实世界紧急环境上达到了接近最优的性能。

关键词

引用

@article{arxiv.1905.09673,
  title  = {Deep Q-Learning with Q-Matrix Transfer Learning for Novel Fire Evacuation Environment},
  author = {Jivitesh Sharma and Per-Arne Andersen and Ole-Chrisoffer Granmo and Morten Goodwin},
  journal= {arXiv preprint arXiv:1905.09673},
  year   = {2019}
}

备注

21 pages, 14 figures, 4 tables