中文

归因导诊的模型修复:针对不可靠神经网络行为

机器学习 2026-03-18 v1 人工智能 计算机视觉与模式识别

摘要

神经网络模型因其在非鲁棒特征上的行为而性能下降。由于其不透明的本质,修复模型以解决此问题往往需要繁琐的数据清洗和模型重新训练,导致巨大的计算和人力开销。本文我们利用秩一模型编辑建立归因导诊的模型修复框架,有效定位并纠正模型的不可靠行为。我们首先区分我们的修复设置与现有模型编辑,提出一种在保持模型性能并减少对大量净化样本依赖的前提下纠正不可靠行为的表述。我们进一步揭示了模型修复的瓶颈——跨层的可编辑性异质性。为针对主要的误行为来源,我们引入归因导诊的层级定位方法,用于量化各层的可编辑性并识别导致不可靠性的最主要层。广泛的实验表明,我们的方法在纠正神经网络 Trojans、虚假关联和特征泄漏等不可靠性方面效果显著。我们的办法通过使用单个净化样本即可实现编辑目标,具有实际应用价值。

关键词

引用

@article{arxiv.2603.15656,
  title  = {Attribution-Guided Model Rectification of Unreliable Neural Network Behaviors},
  author = {Peiyu Yang and Naveed Akhtar and Jiantong Jiang and Ajmal Mian},
  journal= {arXiv preprint arXiv:2603.15656},
  year   = {2026}
}

备注

Accepted to CVPR 2026