中文

通过对抗数据集生成分析神经网络预测的公平性

机器学习 2026-02-12 v1

摘要

解释深度神经网络的推理时行为仍是一个具有挑战性的问题。现有的对抗性解释方法通常询问:哪些是最接近的备用输入,以便按需方式改变模型的预测?相反,我们探索对抗性数据集。我们的 method 不通过扰动输入,而是高效地找到最近的备用训练数据集,该数据集与原始数据集仅通过改变少数标签而有所不同。在该数据集上训练新模型然后可以导致对给定测试实例产生不同的预测。从这个角度来看,这提供了一种全新的方法来评估公平性,通过直接分析标签偏见对训练和推理的影响。我们的 method 可表述为探测给定预测是否取决于偏见标签。由于穷举枚举所有可能的备用数据集是不可行的,我们开发了分析技术,追踪训练数据中的偏见如何通过学习算法传播到训练好的神经网络。我们的 method 通过对有限数量的训练样本标签进行排序和修改来构建对抗性数据集,然后重新训练模型并检查其对选定测试案例的预测是否发生变化。我们在来自 7 个广泛使用公平性数据集的 1100 多个测试案例上对前馈神经网络进行评估。结果表明,它仅修改了少数训练标签,凸显其指向性地识别驱动预测变化的关键训练样本的能力。最后,我们展示了对抗性数据集揭示了训练样本与测试案例之间的联系,提供了一种可解释的方式来探测数据集偏见。

关键词

引用

@article{arxiv.2602.10457,
  title  = {Analyzing Fairness of Neural Network Prediction via Counterfactual Dataset Generation},
  author = {Brian Hyeongseok Kim and Jacqueline L. Mitchell and Chao Wang},
  journal= {arXiv preprint arXiv:2602.10457},
  year   = {2026}
}

备注

Presented at NLDL 2026