中文

Trans-EnV:评估 LLM 针对英语变体语言鲁棒性的框架

计算与语言 2025-10-10 v3 人工智能

摘要

大型语言模型(LLM)主要在标准美国英语(SAE)上进行评估,往往忽略了全球英语变体的多样性。这种狭隘的关注可能会引发公平性问题,因为在非标准变体上性能的下降可能导致全球用户获得不平等的收益。因此,全面评估 LLM 在多种非标准英语变体上的语言鲁棒性至关重要。我们引入了 Trans-EnV,这是一个自动将 SAE 数据集转换为多种英语变体以评估语言鲁棒性的框架。我们的框架结合了:(1)语言学专家知识,用于从语言学文献和语料库中整理特定变体的特征和转换指南;以及(2)基于 LLM 的转换,以确保语言学有效性和可扩展性。使用 Trans-EnV,我们将六个基准数据集转换为 38 种英语变体,并评估了七个最先进的 LLM。我们的结果揭示了显著的性能差异,在非标准变体上的准确率最多下降了 46.3%。这些发现凸显了在多样化英语变体中进行全面语言鲁棒性评估的重要性。Trans-EnV 的每次构建均通过严格的统计检验并咨询了第二语言习得领域的研究人员,以确保其语言学有效性。我们的代码和数据集公开获取于 https://github.com/jiyounglee-0523/TransEnV 和 https://huggingface.co/collections/jiyounglee0523/transenv-681eadb3c0c8cf363b363fb1。

关键词

引用

@article{arxiv.2505.20875,
  title  = {Trans-EnV: A Framework for Evaluating the Linguistic Robustness of LLMs Against English Varieties},
  author = {Jiyoung Lee and Seungho Kim and Jieun Han and Jun-Min Lee and Kitaek Kim and Alice Oh and Edward Choi},
  journal= {arXiv preprint arXiv:2505.20875},
  year   = {2025}
}

备注

NeurIPS 2025 Track on Datasets and Benchmarks (27 pages, 6 figures, 16 tables)