衡量机制性独立性:偏见能否在不擦除人口统计信息的情况下被移除?
计算与语言
2025-12-25 v1
摘要
我们探讨了语言模型中人口统计偏见机制与通用人口统计识别之间的独立性。使用多任务评估设置,其中将人口统计与姓名、职业和教育水平关联,我们测量模型在保持人口统计检测能力的同时能否进行去偏。我们比较了基于归因和基于相关的方法用于定位偏见特征。我们发现,针对 Gemma-2-9B 的针对性稀疏自编码器特征消除可在不降低识别性能的情况下减少偏见:基于归因的消除措施可缓解种族和性别职业刻板印象,同时保持姓名识别准确率,而基于相关的消除措施在教育偏见方面更有效。定性分析进一步揭示,教育任务中的特征消除会导致“先验崩溃”,从而增加整体偏见。这凸显了基于维度的干预的必要性。总体而言,我们的结果表明,人口统计偏见源于特定任务的机制而非绝对的人口统计标记,机制推理时干预能够实现而不损害核心模型能力的精准去偏。
关键词
引用
@article{arxiv.2512.20796,
title = {Measuring Mechanistic Independence: Can Bias Be Removed Without Erasing Demographics?},
author = {Zhengyang Shan and Aaron Mueller},
journal= {arXiv preprint arXiv:2512.20796},
year = {2025}
}