面向基础模型的表示级偏见缓解评估
计算与语言
2026-04-13 v1 机器学习
摘要
我们探究成功的偏见缓解如何重塑编码器专用和解码器专用基础模型的嵌入空间,通过表示分析提供模型行为的内部审计。我们以BERT和Llama2为代表性架构,评估基线和偏见缓解变体模型中性别与职业术语之间的关联变化。我们的发现表明,偏见缓解减少了嵌入空间中的性别-职业差异,导致更中性、更平衡的内部表示。这些表示层面的变化在两种模型类型中均一致,表明公平性改进可表现为可解释且可几何化的转换。这些结果将嵌入分析定位为理解和验证基础模型中去偏方法有效性的有价值工具。为进一步推动解码器专用模型的评估,我们引入WinoDec——一个包含4000个包含性别与职业术语的序列的数据集,并向公众发布。(https://github.com/winodec/wino-dec)
引用
@article{arxiv.2604.08561,
title = {A Representation-Level Assessment of Bias Mitigation in Foundation Models},
author = {Svetoslav Nizhnichenkov and Rahul Nair and Elizabeth Daly and Brian Mac Namee},
journal= {arXiv preprint arXiv:2604.08561},
year = {2026}
}
备注
Accepted at ECML-PKDD 2025 (5th Workshop on Bias and Fairness in AI)