近期大型预训练模型中社会偏见的评估
计算与语言
2023-04-17 v1 计算机与社会
机器学习
摘要
大型预训练语言模型在社区中被广泛使用。这些模型通常在来自互联网等开放来源的未经审核与过滤的数据上训练。因此,我们在线上平台看到的、反映社会偏见的那些偏见被这些模型捕获并学习。这些模型部署于影响数百万人的应用中,其固有偏见对目标社会群体有害。本文中,我们研究了随着更新的预训练模型发布,偏见减少的总体趋势。选取了三个近期模型(ELECTRA、DeBERTa和DistilBERT),并使用两个偏见基准StereoSet和CrowS-Pairs进行评估。它们使用相关指标与BERT基线进行比较。我们探究:随着进展的取得以及更新、更快、更轻模型的发布,这些模型是否得以负责任地开发,使其固有社会偏见相较旧有模型有所降低?结果汇总后我们发现,所研究的所有模型确实都表现出偏见,但相较BERT总体有所改善。
引用
@article{arxiv.2304.06861,
title = {Evaluation of Social Biases in Recent Large Pre-Trained Models},
author = {Swapnil Sharma and Nikita Anand and Kranthi Kiran G. V. and Alind Jain},
journal= {arXiv preprint arXiv:2304.06861},
year = {2023}
}
备注
7 pages, 4 Tables