你的公平性可能不同:预训练语言模型在有毒文本分类中的公平性
计算与语言
2022-04-15 v3 机器学习
摘要
预训练语言模型在自然语言处理系统中的流行要求在下游任务中仔细评估这些模型,因为这些任务具有更高的社会影响潜力。此类系统的评估通常侧重于准确率指标。本文的研究结果呼吁也应关注公平性指标。通过对十多个不同规模的预训练语言模型在两个有毒文本分类任务(英语)上的分析,我们证明仅关注准确率指标可能导致模型在公平性特征上存在巨大差异。具体而言,我们观察到随着训练数据规模的增加和不同的随机初始化,公平性的变化甚至可能比准确率更大。同时,我们发现尽管文献中有相关声称,但模型规模几乎不能解释公平性的变化。为了在不重新训练的情况下提高模型公平性,我们展示了两种为结构化表格数据开发的后处理方法可以成功应用于一系列预训练语言模型。警告:本文包含冒犯性文本样本。
引用
@article{arxiv.2108.01250,
title = {Your fairness may vary: Pretrained language model fairness in toxic text classification},
author = {Ioana Baldini and Dennis Wei and Karthikeyan Natesan Ramamurthy and Mikhail Yurochkin and Moninder Singh},
journal= {arXiv preprint arXiv:2108.01250},
year = {2022}
}
备注
Findings of ACL 2022