中文

向转移式忘卸探索:跨域偏差缓解的实证证据

计算与语言 2024-07-25 v1 机器学习

摘要

大型语言模型(Large language models, LLMs)常常继承自大规模训练语料库中的偏见。虽然传统去偏方法在某种程度上有效,但并未完全消除 LLMs 中记忆的偏见和有害内容。在本文中,我们研究了一种基于忘卸的去偏方法,通过对少数族裔群体的仇恨言论执行梯度上升,即最小化有偏或有害内容的可能性。具体而言,我们提出了一种掩码语言建模忘卸技术,该技术“忘卸”文本的有害部分。该方法使 LLMs 能够选择性地遗忘并与有偏和有害内容脱钩。实验结果表明,我们的方法在减轻偏见的同时保持了语言建模能力。意外结果还揭示了跨域转移忘卸的潜在潜力:在一种偏见形式(例如性别)上进行去偏,可能有助于缓解其他偏见形式(例如种族和宗教)。

关键词

引用

@article{arxiv.2407.16951,
  title  = {Towards Transfer Unlearning: Empirical Evidence of Cross-Domain Bias Mitigation},
  author = {Huimin Lu and Masaru Isonuma and Junichiro Mori and Ichiro Sakata},
  journal= {arXiv preprint arXiv:2407.16951},
  year   = {2024}
}