中文

CausalDetox:用于语言模型去毒化的因果头选择与干预

计算与语言 2026-04-17 v1 人工智能

摘要

大型语言模型(LLMs)经常生成有毒内容,对安全部署构成重大风险。当前的缓解策略通常会降低生成质量或需要昂贵的人工标注。我们提出了CAUSALDETOX,一个识别并干预因果上导致有毒生成的特定注意力头的框架。利用必要性和充分性概率(PNS),我们隔离出一个对毒性既必要又充分的最小注意力头集合。我们通过两种互补策略利用这些组件:(1) 局部推理时干预,构建动态的、输入特定的引导向量以实现上下文感知的去毒化;(2) PNS引导的微调,永久性地遗忘有毒表征。我们还引入了PARATOX,一个由对齐的有毒/无毒句子对组成的新基准,用于受控的反事实评估。在ToxiGen、ImplicitHate和ParaDetox上的实验表明,与基线相比,CAUSALDETOX在保持语言流畅性的同时,实现了高达5.34%的额外毒性降低,并在注意力头选择上提供了7倍的加速。

关键词

引用

@article{arxiv.2604.14602,
  title  = {CausalDetox: Causal Head Selection and Intervention for Language Model Detoxification},
  author = {Yian Wang and Yuen Chen and Agam Goyal and Hari Sundaram},
  journal= {arXiv preprint arXiv:2604.14602},
  year   = {2026}
}

备注

Accepted to ACL 2026. 22 pages, 1 figure