基于行为模仿的深度神经网络修复
机器学习
2023-05-09 v1 人工智能
软件工程
摘要
深度神经网络(DNNs)在安全关键系统中的日益使用引发了对其可能出现异常行为的担忧。尽管 DNN 验证与测试能就意外行为提供事后结论,但它们无法阻止错误行为的发生。为解决该问题,DNN 修复/补丁旨在消除缺陷 DNN 产生的意外预测。两种典型的 DNN 修复范式是重训练与微调。然而,现有方法聚焦于状态空间的高层抽象解释或推断,忽略了底层神经元的输出。这使得补丁过程计算代价高昂,且在很大程度上局限于分段线性(PWL)激活函数。为克服这些不足,我们提出一种基于行为模仿的修复框架 BIRDNN,首次将两种修复范式相集成。BIRDNN 在重训练修复过程中通过模仿正样本最接近的预期行为来纠正负样本的错误预测。对于微调修复过程,BIRDNN 分析神经元在正、负样本上的行为差异,以识别对错误行为最负责任的神经元。为应对更具挑战性的域级修复问题(DRPs),我们将 BIRDNN 与域行为表征技术相合成,以近似正确的风格修复有缺陷的 DNN。我们还基于 BIRDNN 实现了原型工具,并在 ACAS Xu DNNs 上进行了评估。实验结果表明,BIRDNN 能成功修复有缺陷的 DNN,且效率显著高于最先进的修复工具。此外,BIRDNN 与不同激活函数高度兼容。
引用
@article{arxiv.2305.03365,
title = {Repairing Deep Neural Networks Based on Behavior Imitation},
author = {Zhen Liang and Taoran Wu and Changyuan Zhao and Wanwei Liu and Bai Xue and Wenjing Yang and Ji Wang},
journal= {arXiv preprint arXiv:2305.03365},
year = {2023}
}
备注
12 pages, 3 figures