中文

面向安全与可解释性的强化学习策略剪枝

机器学习 2024-09-17 v1

摘要

剪枝神经网络(NN)可以精简网络,但存在从安全强化学习(RL)策略中移除关键参数的风险。我们引入了一种名为 VERINTER 的可解释强化学习方法,该方法将神经网络剪枝与模型检测相结合,以确保可解释的强化学习安全性。VERINTER 通过分析安全度量的变化,精确量化了剪枝和神经连接对复杂安全属性的影响。该方法在剪枝后的强化学习策略中保持了安全性,并增强了对安全动态的理解,这在多种强化学习场景中已被证明是有效的。

关键词

引用

@article{arxiv.2409.10218,
  title  = {Safety-Oriented Pruning and Interpretation of Reinforcement Learning Policies},
  author = {Dennis Gross and Helge Spieker},
  journal= {arXiv preprint arXiv:2409.10218},
  year   = {2024}
}