不完全信息与约束下深度强化学习驱动的检测与维护规划
人工智能
2020-07-06 v1 机器学习
最优化与控制
机器学习
摘要
在退化工程环境中,确定检测与维护策略以最小化长期风险与成本,构成一个复杂的优化问题。主要计算挑战包括:(i) 维度灾难,源于状态/动作集基数随组件数量呈指数级增长;(ii) 历史灾难,与决策树随决策步数呈指数增长有关;(iii) 状态不确定性,由固有环境随机性和检测/监测测量的变异性引起;(iv) 约束的存在,涉及因资源稀缺及其他不可行/非期望系统响应导致的随机长期限制。本工作在一个约束部分可观测马尔可夫决策过程(POMDP)与多智能体深度强化学习(DRL)的联合框架内应对这些挑战。POMDP 结合随机动态规划与贝叶斯推断原理,最优地处理 (ii)-(iii)。多智能体 DRL 通过深度函数参数化和分散控制假设解决 (i)。挑战 (iv) 在此通过适当的状态增广和拉格朗日松弛来处理,重点关注基于生命周期风险的约束和预算限制。本文给出了底层算法步骤,并发现所提出的框架在需要以最注重资源和风险的方式做出决策的情况下,优于已确立的策略基线,并能促进检测与干预行动的精准制定。
引用
@article{arxiv.2007.01380,
title = {Deep reinforcement learning driven inspection and maintenance planning under incomplete information and constraints},
author = {C. P. Andriotis and K. G. Papakonstantinou},
journal= {arXiv preprint arXiv:2007.01380},
year = {2020}
}