中文

FairLex:用于评估法律文本处理公平性的多语言基准

计算与语言 2022-03-15 v1

摘要

我们提出了一套包含四个数据集的基准,用于评估预训练语言模型及其用于下游任务微调的技术的公平性。我们的基准涵盖四个司法管辖区(欧洲理事会、美国、瑞士和中国)、五种语言(英语、德语、法语、意大利语和汉语)以及五个属性(性别、年龄、地区、语言和法域)上的公平性。在我们的实验中,我们使用多种群体鲁棒微调技术评估预训练语言模型,结果表明性能上的群体差异在许多情况下十分显著,而这些技术均无法保证公平性,也无法一致地缓解群体差异。此外,我们对结果进行了定量与定性分析,指出了法律 NLP 鲁棒性方法开发中的开放挑战。

关键词

引用

@article{arxiv.2203.07228,
  title  = {FairLex: A Multilingual Benchmark for Evaluating Fairness in Legal Text Processing},
  author = {Ilias Chalkidis and Tommaso Pasini and Sheng Zhang and Letizia Tomada and Sebastian Felix Schwemer and Anders Søgaard},
  journal= {arXiv preprint arXiv:2203.07228},
  year   = {2022}
}

备注

9 pages, long paper at ACL 2022 proceedings