中文

StereoTales:用于LLM中开放式刻板印象发现的多语言框架

计算机与社会 2026-05-13 v2 人工智能 计算与语言

摘要

关于开放式LLM生成中社会偏见的多语言研究仍然有限:大多数现有基准是英语中心的、基于模板的,或仅限于识别预先指定的刻板印象。我们引入了StereoTales,一个多语言数据集和评估流程,用于系统研究开放式LLM生成中社会偏见的出现。该数据集涵盖10种语言和79个社会人口属性,包含由23个近期LLM生成的超过65万个故事,每个故事都标注了主角在19个维度上的社会人口特征。从中,我们应用统计检验识别出超过1500个过度代表的关联,然后通过人工小组(N=247)和相同的LLM对这些关联的有害性进行评级。我们报告了三个主要发现。**(i)** 我们评估的每个模型,无论其大小或能力如何,都会在开放式生成中发出有害的刻板印象,并且这些关联在很大程度上是跨提供商共享的,而不是孤立的错误行为。**(ii)** 提示语言强烈影响哪些刻板印象出现:有害关联并非作为一组共享的偏见转移,而是文化上适应提示语言,并放大针对当地显著受保护群体的偏见。**(iii)** 人类和LLM的有害性判断大致一致(Spearman ρ=0.62\rho=0.62),分歧集中在特定的属性类别上,而不是特定的提供商。为了支持进一步分析,我们发布了评估代码和数据集,包括模型生成、属性注释和有害性评级。

关键词

引用

@article{arxiv.2605.10442,
  title  = {StereoTales: A Multilingual Framework for Open-Ended Stereotype Discovery in LLMs},
  author = {Pierre Le Jeune and Étienne Duchesne and Weixuan Xiao and Stefano Palminteri and Bazire Houssin and Benoît Malézieux and Matteo Dora},
  journal= {arXiv preprint arXiv:2605.10442},
  year   = {2026}
}

备注

Preprint