基于效用的基础设施维护优化的深度多目标强化学习
人工智能
2025-01-09 v2 机器学习
摘要
在本文中,我们介绍了多目标深度集中式多智能体Actor-Critic(MO-DCMAC),这是一种用于基础设施维护优化的多目标强化学习(MORL)方法,该领域传统上由单目标强化学习(RL)方法主导。先前的单目标RL方法通过奖励塑形将多个目标(如倒塌概率和成本)组合成一个单一的奖励信号。相比之下,MO-DCMAC可以直接针对多个目标优化策略,即使效用函数是非线性的。我们使用两个以倒塌概率和成本为输入的效用函数评估了MO-DCMAC。第一个效用函数是阈值效用,其中MO-DCMAC应最小化成本,使得倒塌概率始终不超过阈值。第二个基于资产管理者用于评估维护计划的失效模式、影响及危害性分析(FMECA)方法。我们在多个维护环境中评估了具有这两个效用函数的MO-DCMAC,包括基于阿姆斯特丹历史护岸墙案例研究的环境。我们将MO-DCMAC的性能与基于当前用于构建维护计划的启发式方法的多个基于规则的策略进行了比较。我们的结果表明,MO-DCMAC在各种环境和效用函数下均优于传统的基于规则的策略。
引用
@article{arxiv.2406.06184,
title = {Deep Multi-Objective Reinforcement Learning for Utility-Based Infrastructural Maintenance Optimization},
author = {Jesse van Remmerden and Maurice Kenter and Diederik M. Roijers and Charalampos Andriotis and Yingqian Zhang and Zaharah Bukhsh},
journal= {arXiv preprint arXiv:2406.06184},
year = {2025}
}
备注
Accepted in the Neural Computing and Applications: Topical Collection on Multi-Objective Decision Making 2023 (MODeM 2023)