大语言模型作为非裔美国人英语语法特征标注工具的分析
计算与语言
2025-08-26 v1 人工智能
机器学习
摘要
非裔美国人英语(AAE)在自然语言处理(NLP)中提出了独特的挑战。本研究系统地比较了现有NLP模型——基于规则的模型、基于Transformer的模型和大语言模型(LLM)——在识别AAE关键语法特征(即习惯性“Be”和多重否定)方面的性能。选择这些特征是因为它们独特的语法复杂性和出现频率。评估涉及句子级别的二分类任务,采用零样本和少样本策略。分析表明,尽管LLM与基线相比显示出潜力,但它们会受到偏见的影响,例如近因效应和文本中无关特征(如正式程度)的影响。这项研究强调了改进模型训练和架构调整的必要性,以更好地适应AAE独特的语言特性。数据和代码已公开。
引用
@article{arxiv.2502.06004,
title = {Analysis of LLM as a grammatical feature tagger for African American English},
author = {Rahul Porwal and Alice Rozet and Pryce Houck and Jotsna Gowda and Sarah Moeller and Kevin Tang},
journal= {arXiv preprint arXiv:2502.06004},
year = {2025}
}
备注
13 pages, Accepted to "Findings of the Association for Computational Linguistics: NAACL 2025"