中文

模型与评估:面向多语言文本分类的公平性研究

计算与语言 2023-03-29 v1

摘要

近年来,越来越多的研究关注于解决文本分类模型中的偏差问题。然而,现有研究主要聚焦于单语言文本分类模型的公平性,关于多语言文本分类公平性的研究仍十分有限。本文关注多语言文本分类任务,提出了一种基于对比学习的多语言文本分类去偏框架。我们所提方法不依赖任何外部语言资源,并可扩展至任意其他语言。该模型包含四个模块:多语言文本表示模块、语言融合模块、文本去偏模块和文本分类模块。多语言文本表示模块使用多语言预训练语言模型表示文本,语言融合模块通过对比学习使不同语言的语义空间趋于一致,文本去偏模块利用对比学习使模型无法识别敏感属性信息。文本分类模块完成多语言文本分类的基本任务。此外,现有多语言文本分类公平性研究在评估方式上相对简单,其公平性评估方法与单语言均等差异评估方法相同,即在单一语言上进行评估。我们提出了一种面向多语言文本分类的多维公平性评估框架,用于评估模型的单语言均等差异、多语言均等差异、多语言均等性能差异以及公平性策略的破坏性。我们希望我们的工作能为多语言文本公平性任务提供更通用的去偏方法和更全面的评估框架。

关键词

引用

@article{arxiv.2303.15697,
  title  = {Model and Evaluation: Towards Fairness in Multilingual Text Classification},
  author = {Nankai Lin and Junheng He and Zhenghang Tang and Dong Zhou and Aimin Yang},
  journal= {arXiv preprint arXiv:2303.15697},
  year   = {2023}
}