自然语言处理的“殖民冲动”:孟加拉语情感分析工具及其基于身份的偏见审计
计算与语言
2024-01-22 v1 计算机与社会
人机交互
机器学习
摘要
尽管殖民主义在社会历史层面影响了人们各个维度的身份,但这些殖民价值观和偏见继续被社会技术系统所延续。作为社会技术系统的一类,情感分析工具同样可能延续殖民价值观与偏见,尽管它们常被用于指导各种实践(例如内容审核),但较少有研究关注此类工具如何成为延续殖民性的共谋。在本文中,我们探讨了孟加拉语社区背景下的情感分析工具的潜在偏见,这些社区曾经历并继续承受殖民主义的影响。基于当地孟加拉语社区受殖民主义影响最深的身份类别,我们将分析重点放在性别、宗教和国籍上。我们对 Python 包索引和 GitHub 上所有可用的孟加拉语情感分析工具进行了算法审计。尽管语义内容和结构相似,我们的分析表明,除了不同工具的输出存在不一致外,孟加拉语情感分析工具在不同身份类别之间表现出偏见,并且对不同身份表达方式的响应也有所不同。我们将研究结果与孟加拉语社区受殖民塑造的社会文化结构相联系,探讨了情感分析工具下游偏见的启示。
引用
@article{arxiv.2401.10535,
title = {The "Colonial Impulse" of Natural Language Processing: An Audit of Bengali Sentiment Analysis Tools and Their Identity-based Biases},
author = {Dipto Das and Shion Guha and Jed Brubaker and Bryan Semaan},
journal= {arXiv preprint arXiv:2401.10535},
year = {2024}
}