中文

迈向过程公平性:揭示毒性语言分类器利用情感信息中的偏差

计算与语言 2022-10-20 v1

摘要

先前关于毒性语言分类器公平性的研究比较了以不同身份术语作为输入特征时模型的输出,但未考虑上下文中其他重要概念的影响。此处,除身份术语外,我们考量分类器学到的高层潜在特征,并探究这些特征与身份术语之间的相互作用。针对一个多类毒性语言分类器,我们利用基于概念的解释框架来计算模型对情感概念的敏感性,该概念此前已被用作毒性语言检测的显著特征。我们的结果表明,尽管对于某些类别,分类器如预期般学到了情感信息,但这一信息被作为输入特征的身份术语的影响所压倒。本工作是迈向评估过程公平性的一步,其中不公平的过程导致不公平的结果。所产生的知识可指导去偏技术,以确保除身份术语外的重要概念在训练数据集中得到充分代表。

关键词

引用

@article{arxiv.2210.10689,
  title  = {Towards Procedural Fairness: Uncovering Biases in How a Toxic Language Classifier Uses Sentiment Information},
  author = {Isar Nejadgholi and Esma Balkır and Kathleen C. Fraser and Svetlana Kiritchenko},
  journal= {arXiv preprint arXiv:2210.10689},
  year   = {2022}
}

备注

13 pages, 2 figures, accepted at the fifth edition of BlackBoxNLP collocated with EMNLP2022