文本数据偏见检测与缓解 —— 基于可扩展管线的实验评估
计算与语言
2025-12-15 v2 人工智能
摘要
用于训练大语言模型(LLM)的文本数据呈现多维偏见表现,包括有害语言和人口统计分布的偏斜。欧洲人工智能法案等监管措施要求识别并缓解针对受保护群体的数据偏见,最终目标是防止不公平的模型输出。然而,实际指导和操作化程度不足。我们提出了包括四个组成部分的全面数据偏见检测与缓解管线,用于解决两种数据偏见类型,即表征偏见和(显式)刻板印象,以可配置的敏感属性为中心。首先,我们利用基于质量准则创建的LLM生成词表来检测相关群体标签。其次,使用人口统计代表性得分量化表征偏见。随后,我们采用基于社会语言学的过滤方法检测并缓解刻板印象。最后,通过基于语法和上下文感知的反事实数据增强来补偿表征偏见。我们采用性别、宗教和年龄等案例进行两次评估。首先,通过人工验证和基线比较评估每个独立组件对数据去偏的有效性。研究结果表明,我们成功降低了文本数据集中的表征偏见和(显式)刻板印象。其次,通过对几些(0.6B-8B参数)模型进行偏见基准测试来评估数据去偏对模型偏见减少的影响。该评估揭示了在去偏数据上微调的LLM在偏见基准测试中并不一致地表现出改进,暴露了当前评估方法ology存在的关键缺口,凸显了针对显现模型偏见需要针对性数据操作的必要性。
引用
@article{arxiv.2512.10734,
title = {Textual Data Bias Detection and Mitigation -- An Extensible Pipeline with Experimental Evaluation},
author = {Rebekka Görge and Sujan Sai Gannamaneni and Tabea Naeven and Hammam Abdelwahab and Héctor Allende-Cid and Armin B. Cremers and Lennard Helmer and Michael Mock and Anna Schmitz and Songkai Xue and Elif Yildirir and Maximilian Poretschkin and Stefan Wrobel},
journal= {arXiv preprint arXiv:2512.10734},
year = {2025}
}