面向推理任务的大语言模型方言公平性与鲁棒性评估
计算与语言
2025-06-10 v3 机器学习
摘要
语言并非单一实体。虽然包括多语言基准测试在内的评估方法常被用作大语言模型 (LLM) 性能的代理,但往往忽视语言内部变异的细微差异,未能建模非标准方言说话者的体验。本文聚焦非标准方言 African American Vernacular English (AAVE),提出首个客观评估 LLM 在处理方言跨越经典推理任务(包括算法、数学、逻辑和综合推理)公平性与鲁棒性的框架。我们引入 ReDial (Reasoning with Dialect Queries),包含 1.2K+ 标准英语与 AAVE 并行查询对。我们聘请 AAVE 说话者(包括计算机科学背景的专家)重写诸如 HumanEval 和 GSM8K 等七个流行基准。通过 ReDial,我们评估了包括 GPT、Claude、Llama、Mistral 和 Phi 模型家族在内的广泛使用 LLM。我们的发现表明,这些广泛使用的模型在处理 AAVE 查询时表现出显著的脆弱性和不公平性。我们的工作建立了系统且客观的框架,用于分析 LLM 在方言查询中的偏见。更重要的是,我们指出主流 LLM 在推理任务中对方言说话者提供不公平服务,为未来研究奠定了关键基础。
引用
@article{arxiv.2410.11005,
title = {Assessing Dialect Fairness and Robustness of Large Language Models in Reasoning Tasks},
author = {Fangru Lin and Shaoguang Mao and Emanuele La Malfa and Valentin Hofmann and Adrian de Wynter and Xun Wang and Si-Qing Chen and Michael Wooldridge and Janet B. Pierrehumbert and Furu Wei},
journal= {arXiv preprint arXiv:2410.11005},
year = {2025}
}
备注
ACL 2025 main