中文

Whispering Experts:面向语言模型的毒性缓解神经干预

计算与语言 2024-07-19 v1 人工智能

摘要

大语言模型(LLM)的一个重要问题是其生成有毒语言的能力。本文我们表明,负责毒性的神经元可以通过其判别有毒句子的能力来确定,并且可以通过按此能力比例降低其激活水平来缓解有毒语言。我们提出 AUROC 适应(AurA),这是一种可应用于任何预训练 LLM 的干预方法,用于缓解毒性。由于该干预按每个神经元判别有毒内容的能力比例,其自由于任何模型相关的超参数。我们表明 AurA 能够实现最高可达 2.2×2.2 \times 的毒性降低,仅增加 0.720.72 的 perplexity。我们还表明 AurA 在不同规模模型(从 1.5B 到 40B 参数)中都有效,并且其在缓解有毒语言方面的有效性,在保留常识零样本能力方面,跨越所有规模都成立。AurA 可以与预提示策略结合,使其平均缓解潜力从 1.28×1.28\times 提升到 2.35×2.35\times。此外,AurA 能够抵御旨在喚发有毒内容的对抗性预提示,使其成为一种有效的方法,用于部署更安全、更不毒的模型。

关键词

引用

@article{arxiv.2407.12824,
  title  = {Whispering Experts: Neural Interventions for Toxicity Mitigation in Language Models},
  author = {Xavier Suau and Pieter Delobelle and Katherine Metcalf and Armand Joulin and Nicholas Apostoloff and Luca Zappella and Pau Rodríguez},
  journal= {arXiv preprint arXiv:2407.12824},
  year   = {2024}
}

备注

ICML 2024, 8 pages + appendix