大型语言模型中选择性拒绝偏差的特征化
计算与语言
2025-11-03 v1 计算机与社会
摘要
大型语言模型(LLM)中的安全护栏旨在防止恶意用户大规模生成有害内容。然而,这些措施可能无意中引入或反映新的偏见,因为LLM可能针对某些人口统计族群而拒绝生成有害内容,而针对其他族群则不予拒绝。我们通过审视LLM护栏中针对受目标化的个体和交叉族群的拒绝率、LLM响应类型以及生成拒绝文本的长度,探讨了这种选择性拒绝偏差。我们的结果显示,在性别、性取向、国籍和宗教属性方面均存在选择性拒绝偏差的证据。这导致我们通过间接攻击进一步调查安全影响,即针对先前被拒绝的族群。我们的发现强调,在不同人口统计族群间的安全护栏性能需要更具公平性和鲁棒性。
引用
@article{arxiv.2510.27087,
title = {Characterizing Selective Refusal Bias in Large Language Models},
author = {Adel Khorramrouz and Sharon Levy},
journal= {arXiv preprint arXiv:2510.27087},
year = {2025}
}
备注
21 pages, 12 figures, 14 tables