重定向而非移除:任务依赖的刻板印象揭示大语言模型对齐的局限
计算与语言
2026-04-06 v1
摘要
语言模型有多偏见?答案取决于你如何提问。一款在领导角色中拒绝在种姓之间做出选择的模型,在填空任务中却会可靠地将上层种姓与纯洁联系在一起,将下层种姓与缺乏卫生联系在一起。单一任务基准测试会遗漏这一点,因为它们只捕捉到模型偏见画像的一个切片。我们引入了一个涵盖9种偏见类型的层次化分类体系,包括种姓、语言和地理偏见等研究不足的轴,并通过7项评估任务将其操作化,这些任务涵盖显式决策到隐式关联。使用约45K条提示对7款商业和开源大语言模型进行审计后,我们发现了三个系统性模式。第一,偏见是任务依赖的:模型在显式探测中抵消刻板印象,但在隐式探测中重现刻板印象,同一模型和身份群体在不同任务类型之间的刻板印象得分分歧高达0.43。第二,安全对齐是不对称的:模型拒绝为边缘化群体分配负面特征,但自由地将正面特征与特权群体关联。第三,研究不足的偏见轴在所有模型中表现出最强的刻板印象化,这表明对齐努力跟踪的是基准覆盖率而非危害严重程度。这些结果表明,单一基准审计会系统性地误判大语言模型的偏见,而当前的对齐实践掩盖了表征性伤害而非缓解它。
引用
@article{arxiv.2604.02669,
title = {Redirected, Not Removed: Task-Dependent Stereotyping Reveals the Limits of LLM Alignments},
author = {Divyanshu Kumar and Ishita Gupta and Nitin Aravind Birur and Tanay Baswa and Sahil Agarwal and Prashanth Harshangi},
journal= {arXiv preprint arXiv:2604.02669},
year = {2026}
}