基于奖励鞅的深度强化学习控制系统鲁棒性验证
人工智能
2023-12-18 v1
摘要
深度强化学习 (DRL) 作为一种有效的控制系统方法备受关注。然而,实际部署受到状态扰动的阻碍,这会严重影响系统性能。解决这一关键挑战需要对系统性能进行鲁棒性验证,这涉及回答两个定量问题:(i) 如何为期望累积奖励建立保证界限,以及 (ii) 如何确定累积奖励的尾部界限。在本研究中,我们通过引入奖励鞅,首次提出了针对基于 DRL 的控制系统的鲁棒性验证方法,该方法以严格的数学基础刻画了状态扰动对系统性能在累积奖励方面的影响。我们的验证结果为这两个问题提供了可证明的定量证书。随后,我们证明了奖励鞅可以通过神经网络实现和训练,并适用于不同类型的控制策略。实验结果表明,我们的认证界限在各种基于 DRL 的控制系统上紧密包围了仿真结果,表明了所提方法的有效性和通用性。
引用
@article{arxiv.2312.09695,
title = {Robustness Verification of Deep Reinforcement Learning Based Control Systems using Reward Martingales},
author = {Dapeng Zhi and Peixin Wang and Cheng Chen and Min Zhang},
journal= {arXiv preprint arXiv:2312.09695},
year = {2023}
}