基于刻板印象内容模型的鲁棒偏见缓解方法
计算与语言
2022-10-27 v1
摘要
刻板印象内容模型(SCM)指出,我们倾向于将少数群体视为冷漠、无能或两者兼有。在本文中,我们改编现有工作以证明刻板印象内容模型适用于上下文词嵌入,然后利用这些结果评估一种微调过程,该过程旨在使语言模型远离对少数群体的刻板描绘。我们发现,SCM 术语比与愉悦度相关的人口统计无关术语更能捕捉偏见。此外,通过一种仅需极少人力和计算资源的简单微调过程,我们能够在不损害下游性能的情况下减少模型中刻板印象的存在。我们将这项工作作为去偏过程的原型提出,旨在消除对模型中偏见细节的先验知识的需求。
引用
@article{arxiv.2210.14552,
title = {A Robust Bias Mitigation Procedure Based on the Stereotype Content Model},
author = {Eddie L. Ungless and Amy Rafferty and Hrichika Nag and Björn Ross},
journal= {arXiv preprint arXiv:2210.14552},
year = {2022}
}