哪种英语是 LLM 偏好的? triangulating 对美式英语的结构性偏见于基础模型中
计算与语言
2026-04-07 v1 人工智能
计算机与社会
新兴技术
机器学习
摘要
大型语言模型 (LLM) 正在高风险领域中部署,却仅暴露有限的语言设置,尤其是“English (US)”,尽管英语在全球范围内具有多样性和殖民历史。我们以后殖民主义框架解释其更广泛意义,考察地缘政治历史、数据聚焦、数字主导和语言标准化如何塑造 LLM 开发流程。聚焦两种主流标准变体——美式英语 (AmE) 和英式英语 (BrE),我们构建了 1,813 种 AmE--BrE 变体的精选语料库,提出 DiAlign 方法,用于估计方言对齐程度。我们通过三阶段证据三角化来操作化结构性偏见:(i) 对六大预训练语料库进行审计显示美式英语占主导,(ii) 分词器分析表明英式英语形式的分词成本更高,(iii) 生成评估显示模型输出中持续偏向美式英语。据我们了解,这是首次系统性、多层面的检查标准英语变体在 LLM 开发各阶段的方言不对称。我们发现当代 LLM 将 AmE 确立为事实标准,引发语言同质化、认识正义和全球 AI 部署中的不平等问题,同时激励更具方言包容性的语言技术的实践步骤。
引用
@article{arxiv.2604.04204,
title = {Which English Do LLMs Prefer? Triangulating Structural Bias Towards American English in Foundation Models},
author = {Mir Tafseer Nayeem and Davood Rafiei},
journal= {arXiv preprint arXiv:2604.04204},
year = {2026}
}
备注
Preprint