多样性与语言技术:技术-语言偏见如何导致认知不公
计算机与社会
2023-07-27 v1 计算与语言
摘要
众所周知,基于AI的语言技术——大语言模型、机器翻译系统、多语言词典与语料库——目前仅限于全球最广泛使用及/或资金与政治支持最充分的2%至3%的语言。作为回应,近期研究努力试图将AI技术的覆盖范围扩展至“服务不足的语言”。本文表明,许多此类尝试产生了存在缺陷的方案,其固守对某些语言的表征偏好,我们称之为技术-语言偏见。技术-语言偏见不同于已确立的语言偏见现象,因为它不涉及所表征的语言,而是关乎技术的设计。如本文所示,技术-语言偏见可导致系统只能表达属于主导力量语言与文化的概念,无法正确表征其他社群的概念。我们认为,该问题的根源在于技术开发者社群系统性地倾向于套用一种简化的多样性理解,未能公正对待语言乃至最终使用它们的社群所体现的更深层差异。借助认知不公概念,我们指出了所识别偏见的更广泛社会政治后果,并表明其不仅会导致对有价值多样性方面的忽视,还会造成边缘化语言社群的需求与多元世界观的代表不足。
引用
@article{arxiv.2307.13714,
title = {Diversity and Language Technology: How Techno-Linguistic Bias Can Cause Epistemic Injustice},
author = {Paula Helm and Gábor Bella and Gertraud Koch and Fausto Giunchiglia},
journal= {arXiv preprint arXiv:2307.13714},
year = {2023}
}
备注
arXiv admin note: text overlap with arXiv:2307.13405