Bias Vector:使用任务算术方法缓解语言模型中的偏见
计算与语言
2024-12-17 v1 人工智能
摘要
近年来,语言模型(LM)的使用大幅增加,训练数据中的偏见和刻板印象反映在LM输出中,引发了社会问题。在本文中,受任务算术的启发,我们提出了“Bias Vector”方法来减轻这些LM偏见。Bias Vector方法不需要手动创建去偏数据。我们方法的三个主要步骤包括:(1)使用掩码语言建模在偏见数据上持续训练预训练LM;(2)将Bias Vector构建为偏见LM权重与预训练LM权重之间的差异;(3)从预训练LM的权重中减去Bias Vector以实现去偏。我们在三个LM上使用SEAT评估了Bias Vector方法,并确认平均提高了0.177分。我们证明了Bias Vector方法不会降低LM在GLUE基准测试的下游任务性能。此外,我们检查了控制Bias Vector幅度的缩放因子的影响,以及SEAT上的效应大小,并在SEAT和GLUE基准测试上对我们的去偏LM进行了全面评估。
引用
@article{arxiv.2412.11679,
title = {Bias Vector: Mitigating Biases in Language Models with Task Arithmetic Approach},
author = {Daiki Shirafuji and Makoto Takenaka and Shinya Taguchi},
journal= {arXiv preprint arXiv:2412.11679},
year = {2024}
}
备注
Accepted to COLING2025