利用提示识别并度量预训练语言模型中的词元级情感偏见
计算与语言
2022-04-18 v1
摘要
由于卓越的性能,大规模预训练语言模型(PLMs)已广泛采用于人类社会的诸多方面。然而,我们仍缺乏有效工具来理解嵌入于黑盒模型中的潜在偏见。提示微调(prompt tuning)的近期进展显示了探索PLMs内部机制的可能性。在本工作中,我们提出两种词元级情感测试:情感关联测试(SAT)与情感偏移测试(SST),其利用提示作为探针来检测PLMs中的潜在偏见。我们在情感数据集集合上的实验表明,SAT与SST均能识别PLMs中的情感偏见,且SST能够量化该偏见。结果还表明,微调可能加剧PLMs中已有的偏见。
引用
@article{arxiv.2204.07289,
title = {Identifying and Measuring Token-Level Sentiment Bias in Pre-trained Language Models with Prompts},
author = {Apoorv Garg and Deval Srivastava and Zhiyang Xu and Lifu Huang},
journal= {arXiv preprint arXiv:2204.07289},
year = {2022}
}
备注
5 pages, 2 figures