基于全局有毒子空间的LLM有毒性理解与消除——GloSS方法
计算与语言
2025-05-26 v1 人工智能
摘要
本文探讨了大型语言模型(LLM)中有毒性生成的底层机制,并提出了一种有效的去除有毒性方法。先前的研究通常将前馈网络(FFN)视为有毒性的主要来源,将有毒区域表示为一组有毒向量或层级子空间。然而,我们的深入分析揭示了全局有毒子空间对表示模型中有毒区域更为有效和全面。基于这一洞察,我们提出了GloSS(Global Toxic Subspace Suppression),这是一种轻量级的四阶段方法,通过识别和移除FFN参数中的全局有毒子空间来缓解有毒性。在各种LLM上的实验表明,GloSS实现了在不要求大规模数据或模型再训练的情况下,达到最先进的去除有毒性性能,同时保留了模型的通用能力。
引用
@article{arxiv.2505.17078,
title = {GloSS over Toxicity: Understanding and Mitigating Toxicity in LLMs via Global Toxic Subspace},
author = {Zenghao Duan and Zhiyi Yin and Zhichao Shi and Liang Pang and Shaoling Jing and Jiayi Wu and Yu Yan and Huawei Shen and Xueqi Cheng},
journal= {arXiv preprint arXiv:2505.17078},
year = {2025}
}