中文

WPN:基于N-对比学习的语言模型不可逆性方法

计算与语言 2024-08-20 v1 信息检索

摘要

生成式语言模型(LMs)虽提供诸多优势,但因预训练期间获取的有害知识可能产生不当或有害输出。这种知识常表现为特定有害提示导致有害输出的对应关系,而本研究旨在通过不可逆性技术加以缓解。然而,现有基于梯度上升的不可逆方法会显著损害语言模型性能。为此,我们提出一种新方法,即加权位置N-对(WPN)学习,利用N-对对比学习框架中的位置加权平均池化。WPN旨在通过消除特定有害输出(例如用中性响应取代有毒响应)来修改语言模型的输出分布,从而将模型行为从“有害提示-有害输出”转化为“有害提示-无害响应”。在OPT和GPT-NEO语言模型上的实验表明,WPN有效降低有害响应比例,实现最高达95.8%的无害率,同时在九个常用基准测试上保持稳定性能(平均不超过2%的性能下降)。此外,我们提供实证证据表明WPN在一般化和鲁棒性方面能够削弱有害对应关系,分别在跨域测试集和对抗攻击下进行评估。

关键词

引用

@article{arxiv.2408.09459,
  title  = {WPN: An Unlearning Method Based on N-pair Contrastive Learning in Language Models},
  author = {Guitao Chen and Yunshen Wang and Hongye Sun and Guang Chen},
  journal= {arXiv preprint arXiv:2408.09459},
  year   = {2024}
}

备注

ECAI 2024