中文

深度神经网络的可证公平修复

软件工程 2026-05-20 v1 机器学习

摘要

深度神经网络(DNN)正面临着个体歧视等伦理问题。为此,已develop了大量神经网络修复技术,以调整模型并缓解此类不良行为。然而,现有平等性修复方法通常以数据为中心,往往缺乏可证明的保证且对未见样本的泛化性不足。为克服这些限制,我们提出了 ProF——一种具备可证明保证的平等性修复框架。ProF 的关键直觉是利用区间传播(一种广泛用于神经网络验证技术)对围绕偏置样本 x 整个集合 S(x) 所产生的模型输出进行严格捕获。派生的界限用于引导平等性修复,以鼓励模型在 S(x) 上产生一致输出。具体而言,我们将平等性约束与模型修改统一集成到一个约束求解 formulation 中,可转化为可由成熟求解器求解的混合整数线性规划(MILP)问题。MILP 问题的解有效地诱导一个在整个集合 S(x) 上具备平等性保证的修复模型。我们在四个广泛使用的数据集上评估了 ProF,证明其实现了可证明的平等性修复,关于完整数据集的泛化率可达 95.93%,关于整个输入空间的泛化率可达 93.16%。值得注意的是,ProF 可轻易配置以支持多个敏感属性及更实用的平等性定义,同时提供可证明的修复保证,实现约 90% 的平等性改进。我们的代码已公开于 https://github.com/nninjn/ProF。

关键词

引用

@article{arxiv.2605.19549,
  title  = {Provable Fairness Repair for Deep Neural Networks},
  author = {Jianan Ma and Jingyi Wang and Qi Xuan and Zhen Wang},
  journal= {arXiv preprint arXiv:2605.19549},
  year   = {2026}
}

备注

15 pages, 6 figures, 7 tables. full version of the paper accepted by ASE 2025