从隐私保护预训练中刻画偏 stereotype bias
计算与语言
2024-07-02 v1 人工智能
摘要
差分隐私(DP)可通过利用文本在嵌入空间中单词的空间排列来作用于原始文本。我们研究了此类文本隐私化对语言模型(LMs)及其对偏 stereotype关联倾向的影响。由于前人研究已记录语言熟练程度与偏 stereotype bias相关,因此一个人can假设用于文本隐私化的技术——已知会降低语言建模能力——将抵消不希望的偏 stereotype。通过测试在包含偏 stereotype陈述的文本上训练的BERT模型,这些文本以不同程度的隐私被激活,我们的研究揭示了尽管在加强隐私时偏 stereotype generally减轻,但文本隐私化并不总是等同于消除所有社交领域的偏 stereotype。这突显了对经历文本隐私化的LMs进行偏 stereotype诊断的必要性。
关键词
引用
@article{arxiv.2407.00764,
title = {Characterizing Stereotypical Bias from Privacy-preserving Pre-Training},
author = {Stefan Arnold and Rene Gröbner and Annika Schreiner},
journal= {arXiv preprint arXiv:2407.00764},
year = {2024}
}