中文

西班牙语数字语言偏见:来自 LLM 词汇变体的证据

计算与语言 2026-02-11 v1

摘要

本研究考察了大语言模型 (LLM) 是否捕捉到西班牙语地理词汇变体的程度,该语言在地区变体方面存在显著差异。将 LLM 视作虚拟情报来源,我们利用两种问卷式问题格式:肯定-否定问题和多选问题来探测其方言知识。为此,我们利用了一个大规模、由专家精选的西班牙语词汇变体数据库。我们的评估覆盖超过 900 个词汇项,涵盖 21 个西班牙语国家,分别在国家和方言区域水平上进行。无论采用哪种评估格式,结果均显示 LLM 在表示西班牙语语言变体方面存在系统性差异。与西班牙、赤道几内亚、墨西哥及中美洲以及拉普拉塔河地区相关的词汇变体被模型更准确地识别,而智利语种变体则特别难以被模型区分。重要的是,这些绩效模式并非由国家级数字资源数量差异所解释,这表明数据量之外的因素正在塑造 LLM 中的方言表示。通过提供对地理词汇变体的细粒度、大规模评估,本工作促进了对 LLM 中方言知识的实证理解,并为西班牙语数字语言偏见讨论提供了新证据。

关键词

引用

@article{arxiv.2602.09346,
  title  = {Digital Linguistic Bias in Spanish: Evidence from Lexical Variation in LLMs},
  author = {Yoshifumi Kawasaki},
  journal= {arXiv preprint arXiv:2602.09346},
  year   = {2026}
}