中文

非裔美国英语中 LLM 推理准确性与解释的差异:案例研究

计算与语言 2025-03-07 v1 人工智能

摘要

大型语言模型(LLMs)在推理任务中展现了卓越能力,导致其广泛应用。然而,最近的研究强调了这些模型中令人担忧的偏差,特别是在处理方言变体如非裔美国英语(AAE)方面。在这项工作中,我们系统地研究了 LLM 推理任务中的方言差异。我们开发了一个实验框架,比较了 LLM 在标准美式英语(SAE)和 AAE 提示下的性能,结合了基于 LLM 的方言转换与已建立的语言学分析。我们发现,与等效的 SAE 问题相比,LLMs 对 AAE 输入始终产生准确性较低的响应以及更简单的推理链和解释,在社会科学和人文学科领域差异最为显著。这些发现揭示了 LLMs 处理和理解不同语言变体方式的系统性差异,引发了对在多语言和多方言世界中开发和部署这些系统的重要问题。我们的代码仓库公开发布于 https://github.com/Runtaozhou/dialect_bias_eval。

关键词

引用

@article{arxiv.2503.04099,
  title  = {Disparities in LLM Reasoning Accuracy and Explanations: A Case Study on African American English},
  author = {Runtao Zhou and Guangya Wan and Saadia Gabriel and Sheng Li and Alexander J Gates and Maarten Sap and Thomas Hartvigsen},
  journal= {arXiv preprint arXiv:2503.04099},
  year   = {2025}
}

备注

ARR Under Review, First two authors contribute equally