子空间干预:通过消除LLM生成中的毒性来缓解安全问题
信息检索
2026-02-09 v1
摘要
大型语言模型(LLM)是强大的文本生成器,但即使给出看似无害的提示,也会产生有毒或有害的内容。这构成了严峻的安全挑战,并可能造成现实世界的伤害。毒性往往是细微的且依赖语境的,这使得在词元级别或通过粗糙的句子级信号检测毒性十分困难。此外,消除毒性的努力常常面临安全性与生成文本的连贯性或流畅性之间的权衡。本文提出一种针对性子空间干预策略,用于识别和抑制底层模型表示中隐藏的有毒模式,同时保持生成安全流畅内容的总体能力。在RealToxicityPrompts数据集上,我们的方法相对于现有基线实现了强大的消毒效果,推理复杂度几乎不受影响。跨多个LLM,我们的方法将SOTA消毒系统的毒性降低8%-20%,同时保持可比的流畅性。通过大量定量和定性分析,我们展示该方法能够有效降低毒性而不损害生成性能,始终优于现有基线。
引用
@article{arxiv.2602.06622,
title = {R2LED: Equipping Retrieval and Refinement in Lifelong User Modeling with Semantic IDs for CTR Prediction},
author = {Qidong Liu and Gengnan Wang and Zhichen Liu and Moranxin Wang and Zijian Zhang and Xiao Han and Ni Zhang and Tao Qin and Chen Li},
journal= {arXiv preprint arXiv:2602.06622},
year = {2026}
}