提示后的偏见:大型语言模型中的持久性歧视
计算与语言
2025-11-20 v2 机器学习
摘要
来自偏见迁移假设(BTH)的危险假设是:偏见不会从预训练的大型语言模型(LLM)迁移到适应模型。在我们研究BTH在因果模型下的提示适应情形下(因为提示是实际应用中极其流行和可及的适应策略),我们否定了这一假设。与先前工作相反,我们发现偏见可以通过提示方式迁移,并且流行的基于提示的缓解方法并不一致地防止偏见迁移。具体而言,无论是在人口统计学特征或任务上,内在偏见与提示适应后的偏见保持中等到强相关——例如,在指代消解中性别(rho >= 0.94),在问答中年龄(rho >= 0.98)和宗教(rho >= 0.69)。进一步,我们发现即使在变化few-shot组成参数(如样本量、刻板内容、职业分布和代表性平衡)时,偏见仍保持强相关(rho >= 0.90)。我们评估了几种基于提示的去偏策略,发现不同方法各有优势,但没有一种方法在模型、任务或人口统计学特征上一致降低偏见迁移。这些结果表明,纠正内在模型中的偏见,可能甚至改善推理能力,即可防止偏见向下游任务传播。
引用
@article{arxiv.2509.08146,
title = {Bias after Prompting: Persistent Discrimination in Large Language Models},
author = {Nivedha Sivakumar and Natalie Mackraz and Samira Khorshidi and Krishna Patel and Barry-John Theobald and Luca Zappella and Nicholas Apostoloff},
journal= {arXiv preprint arXiv:2509.08146},
year = {2025}
}