扰动对相似个体准确性与公平性的影响
机器学习
2026-01-27 v2 人工智能
计算机与社会
摘要
深度神经网络(DNNs)对对抗性扰动极其敏感,这些扰动会同时降低预测准确性和个体公平性,在高风险的在线决策中构成关键风险。这种两种鲁棒性维度之间的关系仍然 poorly understood。为填补这一差距,我们引入鲁棒个体公平性(RIF),其要求即使在对抗性操纵下,相似个体也能获得符合相同真实标签的预测。为评估和暴露RIF的违反行为,我们提出RIFair—an一个将相同扰动应用于相似个体以诱发准确性或公平性失效的攻击框架。我们进一步引入扰动影响指数(PII)和扰动影响方向(PID)来量化和解释为何相同的扰动对本应行为相似的个体产生不等效应。实验在多样化模型架构和真实网络数据集上进行,结果表明现有鲁棒性指标捕捉到准确性和公平性中distinct且常常不兼容的失效模式。我们发现许多在线申请人同时容易受到多种对抗失效的威胁,而不准确或不公平的结局是由于相似个体共享相同的PID但拥有明显不同的PIIs,导致预测变化轨迹发生分歧,其中一些个体会更早地跨越决策边界。最后,我们展示RIFair生成的对抗样本可以通过仅替换少数子集项目来策略性地操纵测试集的准确性或公平性,从而制造模型性能的误导性印象。这些发现揭示了当前鲁棒性评估的根本局限,凸显了在高风险在线决策中需联合评估准确性和公平性以应对对抗性扰动的必要性。
引用
@article{arxiv.2404.01356,
title = {Perturbation Effects on Accuracy and Fairness among Similar Individuals},
author = {Xuran Li and Hao Xue and Peng Wu and Xingjun Ma and Zhen Zhang and Huaming Chen and Flora D. Salim},
journal= {arXiv preprint arXiv:2404.01356},
year = {2026}
}