基于提示学习检测自然语言偏见
计算与语言
2023-09-12 v1 人工智能
摘要
在本项目中,我们希望探索新兴的提示工程领域,并将其应用于检测语言模型(LM)偏见的下游任务。更具体地,我们探究如何设计能够指示四类偏见的提示:(1)性别,(2)种族,(3)性取向,以及(4)基于宗教的偏见。在项目内,我们尝试了不同的手工设计提示,以引出语言模型中可能存在的微妙偏见。我们将这些提示应用于多个流行且公认的模型变体:BERT、RoBERTa 和 T5,以评估其偏见。我们提供这些模型的比较分析,并采用双重方法进行评估:使用人类判断来决定模型预测是否存在偏见,以及利用模型级判断(通过进一步提示)来理解模型能否自我诊断其自身预测的偏见。
引用
@article{arxiv.2309.05227,
title = {Detecting Natural Language Biases with Prompt-based Learning},
author = {Md Abdul Aowal and Maliha T Islam and Priyanka Mary Mammen and Sandesh Shetty},
journal= {arXiv preprint arXiv:2309.05227},
year = {2023}
}