中文

大型语言模型对德语方言说话者产生偏见

计算与语言 2025-09-18 v1

摘要

方言是人类文化的重要组成部分,遍布世界各地。德国有超过40%的人口说地方方言(Adler和Hansen,2022)。然而,尽管具有文化意义,说方言的人往往面临负面的社会刻板印象。我们检验了这些刻板印象是否被大型语言模型(LLM)所反映。我们借助方言感知的社会语言学文献,分析了与方言说话者相关联的常见特征。基于这些特征,我们评估了LLM表达的方言命名偏见和方言使用偏见,包括关联任务和决策任务。为评估模型的方言使用偏见,我们构建了一个新评估语料库,将七种地区德语方言(如阿勒曼尼克方言和巴伐利亚方言)的句子与标准德语句子配对。我们发现:(1)在关联任务中,所有评估的LLM都表现出显著的方言命名和方言使用偏见,体现在对方言说话者的负面形容词关联上;(2)所有模型在其决策中也都再现了这些方言命名和方言使用偏见;(3)与先前工作显示LLM在明确提及人口统计学特征时偏见很小的结论相反,我们发现显式标记语言人口统计学特征——德语方言说话者——会放大偏见,而隐式线索如方言使用则不会。

关键词

引用

@article{arxiv.2509.13835,
  title  = {Large Language Models Discriminate Against Speakers of German Dialects},
  author = {Minh Duc Bui and Carolin Holtermann and Valentin Hofmann and Anne Lauscher and Katharina von der Wense},
  journal= {arXiv preprint arXiv:2509.13835},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 Main