中文

低资源语言偏见影响因素:以巴贝克语为例的实证研究

计算与语言 2026-05-08 v2 计算机与社会 人机交互

摘要

社会技术系统,如语言技术,经常表现出基于身份的偏见。这些偏见加剧了历史上被边缘化社区的体验,在低资源环境中仍受到不足的研究。虽然针对特定语言或具有多语言支持的模型和数据集常被推荐用于解决这些偏见,但本文在巴贝克语(Bengali),这是一种广泛使用但资源不足的语言的语境中,对性别、宗教和国籍等身份的偏见,进行了实证测试。我们对基于mBERT和BanglaBERT构建的情感分析模型进行了算法审计,这些模型是使用来自Google数据集搜索的所有巴贝克语情感分析(BSA)数据集微调的。我们的分析表明,BSA模型在不同的身份类别中均表现出偏见,尽管它们具有相似的语义内容和结构。我们还检查了将由来自不同人口统计背景的个人创建的数据集和预训练模型组合时所产生的不一致性和不确定性。我们将这些发现联系到关于知识正义、AI对齐以及算法审计中方法论决策的更广泛讨论中。

关键词

引用

@article{arxiv.2506.06816,
  title  = {How do datasets, developers, and models affect biases in a low-resourced language?: The Case of the Bengali Language},
  author = {Dipto Das and Shion Guha and Bryan Semaan},
  journal= {arXiv preprint arXiv:2506.06816},
  year   = {2026}
}