公平性与可解释性的桥梁:基于输入的解释能否促进仇恨言论检测中的公平性?
计算与语言
2026-02-12 v2 人工智能
摘要
自然语言处理 (NLP) 模型常常复制或放大训练数据中的社会偏见,这引发了公平性的担忧。同时,其黑箱本质使得用户难以识别偏见性预测,开发者也难以有效地加以缓解。虽然一些研究表明,基于输入的解释有助于检测和缓解偏见,但其他研究也质疑其在确保公平性方面的可靠性。现有研究在公平 NLP 可解释性方面主要为定性研究,缺乏大规模定量分析。本文进行了仇恨言论检测中可解释性与公平性关系的第一次系统性研究,关注编码器和解码器模型。我们检验三个关键维度:(1) 识别偏见预测,(2) 选择公平模型,(3) 在模型训练期间缓解偏见。我们的发现表明,基于输入的解释能够有效识别偏见预测,并可作为减少偏见训练的有用监督,但在在候选模型中选择公平模型方面不可靠。我们的代码已公开于 https://github.com/Ewanwong/fairness_x_explainability。
引用
@article{arxiv.2509.22291,
title = {Bridging Fairness and Explainability: Can Input-Based Explanations Promote Fairness in Hate Speech Detection?},
author = {Yifan Wang and Mayank Jobanputra and Ji-Ung Lee and Soyoung Oh and Isabel Valera and Vera Demberg},
journal= {arXiv preprint arXiv:2509.22291},
year = {2026}
}
备注
ICLR 2026