基于深度强化学习的 POMDP 推断与鲁棒求解:以铁路最优维护为例
机器学习
2023-07-18 v1 人工智能
摘要
部分可观测马尔可夫决策过程(POMDPs)可以在随机和不确定环境下对复杂序贯决策问题建模。阻碍其在现实应用中广泛采用的一个主要原因是缺乏合适的 POMDP 模型或其模拟器。可用的求解算法,如强化学习(RL),需要已知转移动力学和观测生成过程,而这些通常未知且推断并非易事。在这项工作中,我们提出了一种通过深度 RL 进行 POMDP 推断与鲁棒求解的组合框架。首先,通过对以动作为条件的隐马尔可夫模型进行马尔可夫链蒙特卡洛采样,联合推断所有转移和观测模型参数,以便从可用数据中恢复完整的后验分布。然后,通过深度 RL 技术求解具有不确定参数的 POMDP,并将参数分布通过域随机化纳入求解中,以开发对模型不确定性鲁棒的解。作为进一步贡献,我们比较了作为无模型 RL 解的 transformer 和长短期记忆网络与基于模型/无模型混合方法的使用。我们将这些方法应用于铁路资产最优维护规划这一现实问题。
引用
@article{arxiv.2307.08082,
title = {POMDP inference and robust solution via deep reinforcement learning: An application to railway optimal maintenance},
author = {Giacomo Arcieri and Cyprien Hoelzl and Oliver Schwery and Daniel Straub and Konstantinos G. Papakonstantinou and Eleni Chatzi},
journal= {arXiv preprint arXiv:2307.08082},
year = {2023}
}