中文

大型语言模型中选择性拒绝偏差的特征化

计算与语言 2025-11-03 v1 计算机与社会

摘要

大型语言模型(LLM)中的安全护栏旨在防止恶意用户大规模生成有害内容。然而,这些措施可能无意中引入或反映新的偏见,因为LLM可能针对某些人口统计族群而拒绝生成有害内容,而针对其他族群则不予拒绝。我们通过审视LLM护栏中针对受目标化的个体和交叉族群的拒绝率、LLM响应类型以及生成拒绝文本的长度,探讨了这种选择性拒绝偏差。我们的结果显示,在性别、性取向、国籍和宗教属性方面均存在选择性拒绝偏差的证据。这导致我们通过间接攻击进一步调查安全影响,即针对先前被拒绝的族群。我们的发现强调,在不同人口统计族群间的安全护栏性能需要更具公平性和鲁棒性。

关键词

引用

@article{arxiv.2510.27087,
  title  = {Characterizing Selective Refusal Bias in Large Language Models},
  author = {Adel Khorramrouz and Sharon Levy},
  journal= {arXiv preprint arXiv:2510.27087},
  year   = {2025}
}

备注

21 pages, 12 figures, 14 tables