中文

Reinfier 与 Reintrainer:基于解释的深度强化学习安全框架

机器学习 2025-02-05 v2 人工智能

摘要

确保深度强化学习(DRL)的可验证性和可解释性安全性对于其在实际应用中的部署至关重要。现有方法如基于验证的循环训练面临部署困难、训练效率低、缺乏可解释性以及属性满足和奖励性能方面的次优问题。本文提出一种新颖的基于验证的解释驱动的循环框架Reintrainer,用于开发可信赖的DRL模型,保证满足预期约束属性。具体而言,在每个迭代中,该框架使用形式化验证度量模型与预定义属性之间的差距,解释每个输入特征对模型输出的贡献,然后生成来自动态度量结果的训练策略,直到证明所有预定义属性。此外,现有验证器和解释器的低可重用性促使我们开发Reinfier,这是Reintrainer中用于DRL验证和解释的通用和基础工具。Reinfier具备断点搜索和基于验证的解释功能,配有简洁的约束编码语言DRLP。评估表明,Reintrainer在六个公共基准测试中在性能和属性保证方面均优于最先进的方法。我们的框架可在https://github.com/Kurayuri/Reinfier访问。

关键词

引用

@article{arxiv.2410.15127,
  title  = {Reinfier and Reintrainer: Verification and Interpretation-Driven Safe Deep Reinforcement Learning Frameworks},
  author = {Zixuan Yang and Jiaqi Zheng and Guihai Chen},
  journal= {arXiv preprint arXiv:2410.15127},
  year   = {2025}
}