用于预训练语言模型检测社会偏见的少样本指令提示
计算与语言
2022-04-19 v2 人工智能
摘要
检测文本中的社会偏见具有挑战性,原因在于其微妙性、主观性,以及难以大规模获取高质量标注数据集,尤其是考虑到社会偏见与社会本身的演化特性。为应对这些挑战,我们提出一种基于少样本指令的预训练语言模型(LM)提示方法。我们从一个小型支持库中选取在嵌入空间中与待标注查询最接近的几个类别平衡样本。随后,我们向 LM 提供由该标注样本子集、待分类查询文本、偏见定义组成的指令,并提示其做出判定。我们证明,在少样本设定下使用的大型 LM 能够检测不同类型的细粒度偏见,其准确率与微调模型相近,有时甚至更优。我们观察到,最大的 530B 参数模型在检测社会偏见方面显著优于较小模型(与其他模型相比 AUC 指标至少提升 13%)。当标注库缩减至仅 个样本时,它仍保持高 AUC(下降小于 2%)。因此,大型预训练语言模型使构建新的偏见检测器变得更轻松、更快速。
引用
@article{arxiv.2112.07868,
title = {Few-shot Instruction Prompts for Pretrained Language Models to Detect Social Biases},
author = {Shrimai Prabhumoye and Rafal Kocielnik and Mohammad Shoeybi and Anima Anandkumar and Bryan Catanzaro},
journal= {arXiv preprint arXiv:2112.07868},
year = {2022}
}
备注
Submission revised with new results