大型语言模型中毒性的测量与缓解:一项全面的复制研究
计算与语言
2026-05-18 v2 机器学习
摘要
在网络规模语料库上训练的大型语言模型(LLM)固有地吸收了其训练数据中的有毒模式。这导致了有毒退化,即即使是无害的提示也可能触发有害输出。这种现象对现实世界的部署构成了重大风险。因此,需要有效的缓解策略,这些策略应在确保安全的同时维持模型效用。在这项全面的复制研究中,我们评估了 DExperts(Decoding-time Experts)的有效性,这是一种推理时缓解技术,可在不需要模型重训练的情况下引导生成。我们将研究结构化为三个系统阶段:(1)在标准 GPT-2 模型上使用 RealToxicityPrompts 建立基线毒性测量;然后(2)实施并评估 DExperts 以缓解显式毒性;最后(3)使用对抗性 ToxiGen 数据集针对隐式仇恨言论对该方法进行压力测试。我们的实证结果证实,虽然 DExperts 在显式毒性基准上实现了近乎完美的安全率(100%),但它在面对对抗性隐式仇恨言论时表现出脆弱性,安全率降至 98.5%。此外,我们量化了一个关键的权衡。该方法引入了 10 倍的延迟惩罚(每次生成从 0.2 秒增加到 2.0 秒),对实时部署场景构成了挑战。本研究通过强调显式毒性缓解与隐式毒性缓解之间的鲁棒性差距,为日益增长的 AI 安全研究体系做出了贡献。我们强调需要更复杂的方法,这些方法能够泛化到多样化的仇恨言论模式,而不会产生过高的计算成本。
引用
@article{arxiv.2605.14087,
title = {Measuring and Mitigating Toxicity in Large Language Models: A Comprehensive Replication Study},
author = {Mokshit Surana and Archit Rathod and Akshaj Satishkumar},
journal= {arXiv preprint arXiv:2605.14087},
year = {2026}
}