面向安全与可解释性的强化学习策略剪枝
机器学习
2024-09-17 v1
摘要
剪枝神经网络(NN)可以精简网络,但存在从安全强化学习(RL)策略中移除关键参数的风险。我们引入了一种名为 VERINTER 的可解释强化学习方法,该方法将神经网络剪枝与模型检测相结合,以确保可解释的强化学习安全性。VERINTER 通过分析安全度量的变化,精确量化了剪枝和神经连接对复杂安全属性的影响。该方法在剪枝后的强化学习策略中保持了安全性,并增强了对安全动态的理解,这在多种强化学习场景中已被证明是有效的。
引用
@article{arxiv.2409.10218,
title = {Safety-Oriented Pruning and Interpretation of Reinforcement Learning Policies},
author = {Dennis Gross and Helge Spieker},
journal= {arXiv preprint arXiv:2409.10218},
year = {2024}
}