向转移式忘卸探索:跨域偏差缓解的实证证据
计算与语言
2024-07-25 v1 机器学习
摘要
大型语言模型(Large language models, LLMs)常常继承自大规模训练语料库中的偏见。虽然传统去偏方法在某种程度上有效,但并未完全消除 LLMs 中记忆的偏见和有害内容。在本文中,我们研究了一种基于忘卸的去偏方法,通过对少数族裔群体的仇恨言论执行梯度上升,即最小化有偏或有害内容的可能性。具体而言,我们提出了一种掩码语言建模忘卸技术,该技术“忘卸”文本的有害部分。该方法使 LLMs 能够选择性地遗忘并与有偏和有害内容脱钩。实验结果表明,我们的方法在减轻偏见的同时保持了语言建模能力。意外结果还揭示了跨域转移忘卸的潜在潜力:在一种偏见形式(例如性别)上进行去偏,可能有助于缓解其他偏见形式(例如种族和宗教)。
引用
@article{arxiv.2407.16951,
title = {Towards Transfer Unlearning: Empirical Evidence of Cross-Domain Bias Mitigation},
author = {Huimin Lu and Masaru Isonuma and Junichiro Mori and Ichiro Sakata},
journal= {arXiv preprint arXiv:2407.16951},
year = {2024}
}