Classist 工具:社会阶层与 NLP 性能相关
计算与语言
2024-03-08 v1
摘要
自 William Labov 关于语言社会分层的奠基性工作 (Labov, 1964) 以来,语言学一直集中努力探索社会人口特征与语言产生和感知之间的联系。虽然有很强的证据表明语言中存在社会人口特征,但它们在自然语言处理 (NLP) 中很少被使用。年龄和性别得到了一定程度的代表,但 Labov 最初的目标——社会经济地位——却明显缺失。然而这很重要。我们通过实证表明,NLP 使社会经济地位较低的群体处于不利地位。我们标注了一个包含 95K 条电影话语的语料库,标注了社会阶层、种族和地理语言变体,并测量了 NLP 系统在三个任务上的性能:语言建模、自动语音识别和语法错误纠正。我们发现可归因于社会经济地位以及种族和地理差异的显著性能差距。随着 NLP 技术变得越来越普遍和日常化,它们必须适应所有语言变体,以避免使已经边缘化的群体处于不利地位。我们主张在未来的语言技术中纳入社会经济阶层。
引用
@article{arxiv.2403.04445,
title = {Classist Tools: Social Class Correlates with Performance in NLP},
author = {Amanda Cercas Curry and Giuseppe Attanasio and Zeerak Talat and Dirk Hovy},
journal= {arXiv preprint arXiv:2403.04445},
year = {2024}
}