中文

通过原像合成与属性细化实现深度神经网络缺陷的可证明修复

密码学与安全 2025-11-12 v1 软件工程

摘要

已知深度神经网络在各种安全威胁(如后门攻击、对抗攻击和安全属性违反)下可能 exhibit 潜在的危险行为,且攻击者与防御者之间存在持续的军备竞赛。本文提出了一种补充视角,利用近期在“神经网络修复”方面的进展来缓解这些安全威胁并在统一框架内修复源于不同安全威胁的各种神经网络缺陷,为实际场景提供一种潜在的银弹解决方案。为大幅推动现有修复技术(因局限于缺乏保证、规模受限、开销较大等问题)在更实用情境下的边界,我们提出了 ProRepair——一个由形式原像合成和属性细化驱动的 novel 可证明神经网络修复框架。关键思想是:(i)合成精确的包围盒来描述特征空间原像,可推导出足以引导后续修复步骤朝正确输出的有界距离项;(ii)执行属性细化以实现手术式修复并扩展到更复杂的任务。我们在六个基准数据集上的四个安全威胁修复任务中评估了 ProRepair,结果显示其在有效性、效率和规模方面均优于现有方法。对于点级修复,ProRepair 在保持性能的同时纠正模型,实现了显著改进的泛化能力,速度较现有可证明方法提升 5 倍至 2000 倍。在区域级修复中,ProRepair 成功修复了所有 36 个安全属性违反实例(相较于最佳现有方法的 8 个),可处理 18 倍更高维度的空间。

关键词

引用

@article{arxiv.2511.07741,
  title  = {Provable Repair of Deep Neural Network Defects by Preimage Synthesis and Property Refinement},
  author = {Jianan Ma and Jingyi Wang and Qi Xuan and Zhen Wang},
  journal= {arXiv preprint arXiv:2511.07741},
  year   = {2025}
}

备注

20 pages, full version of the paper accepted by CCS 2025