中文

挖掘细微偏见:面向多语言、辩论导向的现代大语言模型评估

计算与语言 2026-03-31 v4 计算机与社会

摘要

大型语言模型(LLM)已被广泛部署用于开放式交互,但大多数偏见评估仍依赖英文、分类任务。我们引入 \corpusname,一个新的多语言、辩论风格基准,旨在揭示叙事偏见在真实生成环境中的表现。该数据集涵盖8400个结构化辩论提示,跨越七种语言(从高资源语言如英文、中文到低资源语言如斯瓦希里语、尼日利亚皮奇语)的四个敏感领域——女性权利、倒退、恐怖主义与宗教。我们使用GPT-4o、Claude 3.5 Haiku、DeepSeek-Chat和LLaMA-3-70B等四款旗舰模型,生成超过10万个辩论回复,并自动分类哪些人口群体被指派偏见或现代角色。结果显示,所有模型都复现了根深蒂固的偏见,尽管经过了安全对齐:阿拉伯人被大量关联恐怖主义和宗教(≥89%),非洲人被关联于社会经济学“倒退”(最高达77%),西方群体始终被描绘为现代或进步的。偏见在低资源语言中呈现明显上升,揭示了主要在英文训练的对齐方法难以在全球范围内普遍化。我们的发现凸显了多语言公平性中的持续鸿沟:当前的对齐方法减少了显性毒性,但未能防止开放式上下文中的偏见输出。我们发布 \corpusname 基准及分析框架,以支持下一代多语言偏见评估以及更安全、更具包容性的模型对齐。

关键词

引用

@article{arxiv.2511.01187,
  title  = {Surfacing Subtle Stereotypes: A Multilingual, Debate-Oriented Evaluation of Modern LLMs},
  author = {Muhammed Saeed and Muhammad Abdul-mageed and Shady Shehata},
  journal= {arXiv preprint arXiv:2511.01187},
  year   = {2026}
}