GRADIEND:以偏见为例的神经网络内部特征学习
机器学习
2026-03-10 v4 人工智能
计算与语言
摘要
人工智能系统经常表现出并放大社会偏见,在关键领域导致有害后果。本研究引入一种新颖的编码器-解码器方法,利用模型梯度来学习编码社会偏见信息(如性别、种族和宗教)的特征神经元。我们证明,该方法不仅能识别需要改变哪些模型权重以修改某个特征,甚至能展示这可用于重写模型以消除偏见,同时保持其他能力。我们展示了该方法在各种模型架构上的有效性,并强调了其更广泛的应用潜力。
引用
@article{arxiv.2502.01406,
title = {GRADIEND: Feature Learning within Neural Networks Exemplified through Biases},
author = {Jonathan Drechsel and Steffen Herbold},
journal= {arXiv preprint arXiv:2502.01406},
year = {2026}
}
备注
Accepted at ICLR 2026