AAVENUE:通过新基准检测 AAVE 中的 LLM 偏见
计算与语言
2025-10-17 v3
摘要
检测针对非洲美国 vernacular English(AAVE)的自然语言理解(NLU)任务中的偏见,对于开发包容性自然语言处理(NLP)系统至关重要。为解决方言导致的性能差异问题,本文引入 AAVENUE({AAVE} {N}atural Language {U}nderstanding {E}valuation),用于评估大型语言模型(LLM)在 AAVE 和 Standard American English(SAE)中的 NLU 任务性能。AAVENUE 在现有基准(如 VALUE)基础上进行扩展,取代确定性的语法和形态转换,采用基于 LLM 的翻译方法进行更灵活的处理,显著提升了在翻译关键任务(如 GLUE 和 SuperGLUE 基准)上的多个评估指标性能。我们对比了 AAVENUE 和 VALUE 的翻译方式,选用五款主流 LLM,并综合使用包括流畅度、BARTScore、质量、连贯性和可理解性在内的全面指标。此外,我们邀请了熟练的 AAVE 说话者验证翻译的真实性。我们的评估结果表明,LLMs 在 SAE 任务上的表现普遍优于 AAVE 翻译版的版本,凸显了内在偏见,凸显了需要更包容性 NLP 模型的必要性。我们已在 GitHub 上开源源代码,并在 https://aavenuee.github.io/ 建立网站展示相关工作。
引用
@article{arxiv.2408.14845,
title = {AAVENUE: Detecting LLM Biases on NLU Tasks in AAVE via a Novel Benchmark},
author = {Abhay Gupta and Philip Meng and Ece Yurtseven and Sean O'Brien and Kevin Zhu},
journal= {arXiv preprint arXiv:2408.14845},
year = {2025}
}
备注
Published at NLP4PI @ EMNLP 2024