基于深度强化学习控制的可靠性量化
系统与控制
2024-07-22 v2 人工智能
机器学习
系统与控制
摘要
基于深度强化学习(DRL)控制的可靠性量化是人工智能(AI)在安全关键系统中实际应用的一大挑战。本研究提出一种量化 DRL 控制可靠性的方法。首先,将现有方法随机噪声蒸馏(random noise distillation)应用于可靠性评估,以厘清待解决问题。其次,提出一种新颖的可靠性量化方法以解决这些问题。可靠性使用两个神经网络(参考网络与评估网络)进行量化。它们结构相同且初始参数一致。训练前两个网络的输出相同。训练期间,评估网络参数被更新以最大化其对训练数据在参考与评估网络间的差异。因此,可基于两网络输出的差异评估某状态下 DRL 控制的可靠性。所提方法以 DQN 控制作为简单任务示例应用,并证明了其有效性。最后,将所提方法应用于依据状态切换已训练模型的问题。结果表明,根据可靠性切换已训练模型提升了 DRL 控制的性能。
引用
@article{arxiv.2309.16977,
title = {Reliability Quantification of Deep Reinforcement Learning-based Control},
author = {Hitoshi Yoshioka and Hirotada Hashimoto},
journal= {arXiv preprint arXiv:2309.16977},
year = {2024}
}
备注
18 pages and 17 figures