识别与消除语言模型中的社会偏见知识
计算与语言
2025-02-28 v2 人工智能
摘要
生成公平且准确的预测在将大型语言模型 (LLM) 部署到实际应用中发挥作用至关重要。然而,现有的消除偏见方法不可避免地生成不公平或不正确的预测,因为它们是设计和评估以实现不同社会群体之间的平等,但忽略了个体常识事实,导致修改后的知识引发不合理或不希望的预测。在本文中,我们首先建立了一个新的偏见消除基准 BiaScope,通过利用新构建的数据集和指标系统性地评估性能。然后,我们提出了一种新颖的消除偏见方法 Fairness Stamp (FAST),该方法使对 individual social biases 的细粒度校准成为可能。FAST 识别负责存储社会偏见的决定性层,然后通过整合一个小型模块化网络来校准其输出,同时考虑偏见消除和知识保留的需求。全面的实验表明,FAST 在消除偏见性能方面优于最先进的基线方法,同时未损害模型对知识保留和下游预测的整体能力。这凸显了实现 LLM 公平性的细粒度消除策略的潜力。
引用
@article{arxiv.2408.11843,
title = {Identifying and Mitigating Social Bias Knowledge in Language Models},
author = {Ruizhe Chen and Yichen Li and Jianfei Yang and Joey Tianyi Zhou and Jian Wu and Zuozhu Liu},
journal= {arXiv preprint arXiv:2408.11843},
year = {2025}
}
备注
NAACL 2025 Findings. arXiv admin note: substantial text overlap with arXiv:2405.09341