中文

走出数据之外:面向低资源语言的自动化内容审核管道中的殖民偏见与系统性问题

计算与语言 2025-08-06 v3 人机交互

摘要

大多数社交媒体用户来自全球南方地区,在这些地区,有害内容通常以当地语言出现。然而,面向低资源语言的AI驱动内容审核系统在这些地区的语言方面仍感到困难。通过对来自四个低资源语言的22名AI专家进行半结构化访谈:南亚的泰米人语、东非的斯瓦希里语、北非的摩格利阿拉伯语和南美的克丘亚语——我们检视了在这些语言上构建自动化内容审核工具的系统性问题。我们的发现表明,除了数据稀缺之外,技术公司对用户数据的垄断以及对低利润全球南方市场缺乏对内容审核的投资,加剧了历史上的不平等。即便有更多数据可用,英语中心且数据密集型的语言模型和预处理技术也忽视了为形态复杂、语言多样且代码混合语言进行设计的需求。我们认为,这些限制不仅仅是由“数据稀缺”导致的技术性差距,而是源于对非西方语言的殖民压制所造成的结构性不平等。我们讨论了多利益相关者方法,以加强当地研究能力、民主化数据获取以及支持语言感知解决方案,从而改进面向低资源语言的自动化内容审核。

关键词

引用

@article{arxiv.2501.13836,
  title  = {Think Outside the Data: Colonial Biases and Systemic Issues in Automated Moderation Pipelines for Low-Resource Languages},
  author = {Farhana Shahid and Mona Elswah and Aditya Vashistha},
  journal= {arXiv preprint arXiv:2501.13836},
  year   = {2025}
}

备注

Accepted to AIES 2025