中文

哪种英语是 LLM 偏好的? triangulating 对美式英语的结构性偏见于基础模型中

计算与语言 2026-04-07 v1 人工智能 计算机与社会 新兴技术 机器学习

摘要

大型语言模型 (LLM) 正在高风险领域中部署,却仅暴露有限的语言设置,尤其是“English (US)”,尽管英语在全球范围内具有多样性和殖民历史。我们以后殖民主义框架解释其更广泛意义,考察地缘政治历史、数据聚焦、数字主导和语言标准化如何塑造 LLM 开发流程。聚焦两种主流标准变体——美式英语 (AmE) 和英式英语 (BrE),我们构建了 1,813 种 AmE--BrE 变体的精选语料库,提出 DiAlign 方法,用于估计方言对齐程度。我们通过三阶段证据三角化来操作化结构性偏见:(i) 对六大预训练语料库进行审计显示美式英语占主导,(ii) 分词器分析表明英式英语形式的分词成本更高,(iii) 生成评估显示模型输出中持续偏向美式英语。据我们了解,这是首次系统性、多层面的检查标准英语变体在 LLM 开发各阶段的方言不对称。我们发现当代 LLM 将 AmE 确立为事实标准,引发语言同质化、认识正义和全球 AI 部署中的不平等问题,同时激励更具方言包容性的语言技术的实践步骤。

关键词

引用

@article{arxiv.2604.04204,
  title  = {Which English Do LLMs Prefer? Triangulating Structural Bias Towards American English in Foundation Models},
  author = {Mir Tafseer Nayeem and Davood Rafiei},
  journal= {arXiv preprint arXiv:2604.04204},
  year   = {2026}
}

备注

Preprint