中文

评估非裔美国英语方言在大型语言模型中的使用情况

计算与语言 2026-02-26 v1 人机交互

摘要

在人工智能领域,大多数自然语言理解任务的评估都在标准化方言(如标准美国英语)下进行。本文探讨了大型语言模型(LLM)如何准确地代表非裔美国英语方言(AAVE)。我们分析了三个 LLM,比较其 AAVE 用法与 native 说话者的 AAVE 用法。我们首先分析来自非裔美国语言语料库(Corpus of Regional African American Language)和 TwitterAAE 的访谈记录,确定人们在使用如“ain't"等 AAVE 语法特征时的典型语境。随后,我们引导 LLM 生成 AAVE 文本,并将模型生成的文本与人类用法模式进行比较。我们发现,LLM 在许多情况下与人类用法存在显著差异:LLM 通常低估或误用 AAVE 的特征。此外,通过情感分析和人工检查,我们发现模型复制了关于非裔美国人的刻板印象。这些结果凸显了需要更多样化训练数据以及纠正刻板印象的公平性方法的重要性。

关键词

引用

@article{arxiv.2602.21485,
  title  = {Evaluating the Usage of African-American Vernacular English in Large Language Models},
  author = {Deja Dunlap and R. Thomas McCoy},
  journal= {arXiv preprint arXiv:2602.21485},
  year   = {2026}
}