消除恶意行为:基于全局子空间的 LLM 去毒方法
机器学习
2026-01-13 v1 人工智能
摘要
大型语言模型(LLM)表现卓越,但存在生成有害内容的风险,限制了其安全部署。虽然传统方法(如对齐)调整输出偏好,但无法消除参数中潜在的有害区域,使模型仍然 vulnerable 对抗攻击。先前的机制研究将有害区域描述为“有害向量”或“层级子空间”,但我们的分析识别出关键局限性:i)被删除的有害向量可通过非有害向量的线性组合进行重建,要求针对整个有害子空间进行处理;ii)基于有限样本的对比目标会引入噪声,阻碍层级子空间的稳定提取。这凸显了识别稳健有害子空间并消除其中的挑战。因此,我们提出了 GLOSS(GLobal tOxic Subspace Suppression),一种轻量级方法,通过识别并消除 FFN 参数中的全局子空间来缓解有害性。实验在 LLM(如 Qwen3)上显示,GLOSS 实现了 SOTA 去毒,同时保留了通用能力,无需大规模再训练。 WARNING:本文包含具有有害性的内容。
引用
@article{arxiv.2601.06226,
title = {Projecting Out the Malice: A Global Subspace Approach to LLM Detoxification},
author = {Zenghao Duan and Zhiyi Yin and Zhichao Shi and Liang Pang and Shaoling Jing and Zihe Huang and Jiayi Wu and Yu Yan and Jingcheng Deng and Huawei Shen and Xueqi Cheng},
journal= {arXiv preprint arXiv:2601.06226},
year = {2026}
}