中文

语言模型中文化偏见的起源:从预训练数据到语言现象

计算与语言 2025-01-09 v1

摘要

语言模型(LM)已被证明在非西方语言中表现出对与西方文化相关的实体的强烈偏好。本文旨在通过分析几个影响因素(包括预训练数据中实体的表示以及跨语言语言现象变化的影响),揭示 LM 中与实体相关的文化偏见的起源。我们引入了 CAMeL-2,一个包含 58,086 个与阿拉伯和西方文化相关的实体以及 367 个实体掩码自然上下文的平行阿拉伯语-英语基准。使用 CAMeL-2 的评估显示,LM 在英语测试中与阿拉伯语相比,文化之间的性能差距有所缩小。我们发现,LM 在阿拉伯语中对于预训练中出现频率高且实体可能具有多个词义的实体表现困难。这还扩展到那些与不使用阿拉伯语但使用阿拉伯文字的语言具有高词汇重叠的实体。此外,我们展示了基于频率的分词如何导致 LM 中的这个问题,并且随着阿拉伯语词汇量的增大而变得更糟。我们将公开 CAMeL-2:https://github.com/tareknaous/camel2

关键词

引用

@article{arxiv.2501.04662,
  title  = {On The Origin of Cultural Biases in Language Models: From Pre-training Data to Linguistic Phenomena},
  author = {Tarek Naous and Wei Xu},
  journal= {arXiv preprint arXiv:2501.04662},
  year   = {2025}
}