EnDive:面向大型语言模型公平性与性能的跨方言基准
计算与语言
2025-04-11 v1
摘要
人类语言的多样性受到社会、文化和地区影响,为自然语言处理 (NLP) 系统带来了重大挑战。现有基准常常忽视语言内部的变异,导致非标准方言说话者得到的服务不足。为弥合这一差距,我们引入EnDive (English Diversity),该基准评估了五个广泛使用的大型语言模型 (LLM) 在语言理解、算法推理、数学和逻辑任务中的表现。我们的框架通过使用来自母语者验证示例的零样本提示,将标准美式英语数据集翻译成五种不常见方言,并通过流畅性评估、偏好测试和语义相似性指标将这些翻译与基于规则的方法进行比较。人类评估确认翻译质量高,忠实性、流畅性和形式化程度平均得分至少为6.02/7。通过过滤近似相同翻译,我们创建了一个具有挑战性的数据集,揭示了显著的性能差异——模型在方言输入上 consistently 低于标准美式英语。EnDive因此推动了方言感知NLP的发展,揭示了模型偏见并促进了更公平的语言技术。
引用
@article{arxiv.2504.07100,
title = {EnDive: A Cross-Dialect Benchmark for Fairness and Performance in Large Language Models},
author = {Abhay Gupta and Jacob Cheung and Philip Meng and Shayan Sayyed and Austen Liao and Kevin Zhu and Sean O'Brien},
journal= {arXiv preprint arXiv:2504.07100},
year = {2025}
}