中文

推理时规则擦除器:通过蒸馏与移除偏见规则实现公平识别

机器学习 2024-08-28 v4 人工智能 计算机与社会

摘要

机器学习模型常基于性别、种族等偏见特征做出预测,带来显著的公平性风险,尤其是在招聘、银行和刑事司法等社会应用中。传统解决此问题的方法涉及使用公平性感知优化目标对神经网络进行重训练或微调。然而,这些方法可能因巨大的计算资源、复杂的工业测试以及相关的二氧化碳足迹而不切实际。此外,普通用户通常无法访问模型参数,因此难以微调模型。本文提出推理时规则擦除器(Eraser),一种新颖方法,旨在通过在不改变模型权重的情况下,在推理时从部署模型中移除有偏决策规则来解决公平性问题。我们首先通过贝叶斯分析建立修改模型输出以消除偏见规则的理论基础。接着,我们给出Eraser的具体实现,包括两个阶段:(1)将偏见规则从部署模型蒸馏到一个额外的补丁模型中,(2)在推理时从部署模型的输出中移除这些偏见规则。大量实验验证了我们方法的有效性,展示了其在解决AI系统公平性问题上的优越性能。

关键词

引用

@article{arxiv.2404.04814,
  title  = {Inference-Time Rule Eraser: Fair Recognition via Distilling and Removing Biased Rules},
  author = {Yi Zhang and Dongyuan Lu and Jitao Sang},
  journal= {arXiv preprint arXiv:2404.04814},
  year   = {2024}
}