通过遗忘技术消除语言模型中的社会偏见
计算与语言
2024-06-21 v1 人工智能
摘要
由于语言模型 (LM) 在广泛部署中发挥重要作用,消除其中的偏见已成为关键问题。许多方法依赖于数据预处理和模型微调,这些任务往往耗时且计算资源密集。因此,机器遗忘技术因其低计算成本而受到关注,可有效消除预训练或微调模型中不希望的行为。本文探讨了两种遗忘方法:(1) 基于对比梯度的分区遗忘 (Partitioned Contrastive Gradient Unlearning, PCGU),应用于解码器模型;(2) 通过任务向量实现否定 (Negation via Task Vector),用于降低基于 LLaMA-2 和 OPT 等最新开源大模型中的社会偏见。我们还实现了大规模模型的分布式 PCGU。定量与定性分析表明,任务向量否定方法在保持模型性能和困惑度最小化的同时,对偏见消除效果显著优于 PCGU。在 LLaMA-27B 模型上,任务向量否定方法可将偏见得分降低 11.8%。
引用
@article{arxiv.2406.13551,
title = {Mitigating Social Biases in Language Models through Unlearning},
author = {Omkar Dige and Diljot Singh and Tsz Fung Yau and Qixuan Zhang and Borna Bolandraftar and Xiaodan Zhu and Faiza Khan Khattak},
journal= {arXiv preprint arXiv:2406.13551},
year = {2024}
}