中文

贫乏的语言技术:自然语言处理中(社会)阶级的缺失

计算与语言 2024-03-07 v1 人工智能 计算机与社会

摘要

自 Labov (1964) 关于语言社会分层的奠基性工作以来,语言学一直致力于理解社会人口因素与语言产生及感知之间的关系。尽管有大量证据表明社会人口因素与语言产生之间存在显著关系,但在自然语言处理 (NLP) 技术背景下,对这些因素的调查相对较少。虽然年龄和性别已得到充分覆盖,但 Labov 最初的目标——社会经济阶级——却 largely absent( largely absent 意为 largely absent,此处依语境译为“ largely absent”或“基本缺失”,正式译文中处理为“基本缺失”)。我们 surveyed(调查了)现有的 NLP 文献,发现仅有 20 篇论文提及社会经济地位。然而,这些论文中的大多数除了收集标注者的人口统计信息外,并未深入探讨阶级问题。鉴于这一研究空白,我们提供了一个可由 NLP 研究人员操作化的阶级定义,并主张在未来的语言技术中纳入社会经济阶级。

关键词

引用

@article{arxiv.2403.03874,
  title  = {Impoverished Language Technology: The Lack of (Social) Class in NLP},
  author = {Amanda Cercas Curry and Zeerak Talat and Dirk Hovy},
  journal= {arXiv preprint arXiv:2403.03874},
  year   = {2024}
}

备注

Accepted to LREC-COLING 2024