“宽胶带修不好那个”:编辑后语言模型中的偏见与 misinformation
计算与语言
2024-10-07 v3
摘要
模型编辑已成为更新语言模型中存储知识的具有成本效益的策略。然而,模型编辑在应用后可能会产生意想不到的后果:与编辑无关的信息也可能被改变,模型的其他一般行为也可能被错误地改变。在本工作中,我们研究了模型编辑方法如何在编辑后意外地放大模型偏见。我们引入了一个新的基准数据集 Seesaw-CF,用于衡量模型编辑带来的偏见相关危害,并首次深入调查了不同的权重编辑方法如何影响模型偏见。具体而言,我们关注与种族、地理起源和性别等人口统计属性相关的偏见,以及编辑后的语言模型生成的长篇文本中的定性缺陷。我们发现,编辑后的模型在对亚洲、非洲和南美洲主体的属性信心降低时,表现出不同程度的更多偏见行为。此外,编辑后的模型在文本生成中放大了性别歧视和仇外心理,同时表面上仍保持连贯和逻辑。最后,编辑关于出生地、国籍或性别的事实会对模型关于无关特征(如工作领域)的知识产生特别负面的影响。
引用
@article{arxiv.2403.00180,
title = {"Flex Tape Can't Fix That": Bias and Misinformation in Edited Language Models},
author = {Karina Halevy and Anna Sotnikova and Badr AlKhamissi and Syrielle Montariol and Antoine Bosselut},
journal= {arXiv preprint arXiv:2403.00180},
year = {2024}
}
备注
Accepted to EMNLP 2024 Main. 9 pages, 4 figures