中文

基于毒化逆转的自解毒语言模型

计算与语言 2023-10-17 v1

摘要

语言模型解毒旨在最小化预训练语言模型(PLM)生成攻击性或有害内容的风险,以实现更安全的部署。现有方法大致可分为基于微调的和基于解码的两类。然而,前者通常资源密集,而后者依赖额外组件并可能损害生成流畅度。本文提出一种更轻量的方法,使 PLM 自身实现“自解毒”。我们的方法基于如下观察:前置负面引导提示可有效诱导 PLM 生成有毒内容。同时,我们受近期可解释性领域研究的启发,该研究将 PLM 内演化的上下文表示表述为由注意力层促进的信息流。基于此思想,我们设计了一种方法,从正常生成过程识别到由负面前缀引导的生成过程中的毒化方向,随后通过操纵注意力层内的信息流动将生成导向相反方向。实验结果表明,我们的方法无需任何微调或额外组件,即可取得与最先进方法相当的性能。

关键词

引用

@article{arxiv.2310.09573,
  title  = {Self-Detoxifying Language Models via Toxification Reversal},
  author = {Chak Tou Leong and Yi Cheng and Jiashuo Wang and Jian Wang and Wenjie Li},
  journal= {arXiv preprint arXiv:2310.09573},
  year   = {2023}
}

备注

Accepted by EMNLP 2023 main conference