自适应解毒:通过毒性感知知识编辑保障 LLM 的通用能力
计算与语言
2025-05-29 v1
摘要
大语言模型 (LLM) 展现出令人印象深刻的语言能力,但仍然容易受到恶意提示和越狱攻击的影响。用于 LLM 解毒的现有知识编辑方法面临两大挑战。首先,它们通常依赖于特定实体的定位,这使得它们在面对没有明确实体的对抗性输入时无效。其次,这些方法存在过度编辑问题,解毒后的模型会拒绝合法查询,从而损害整体性能。本文提出 ToxEdit,一种毒性感知的知识编辑方法,可在前向传播过程中动态检测毒性激活模式。随后,它通过自适应的层间路径路由计算以有效缓解毒性。这种设计确保了精确的毒性缓解,同时保留了 LLM 的通用能力。为了更准确地评估过度编辑,我们还通过纳入指令遵循评估任务增强了 SafeEdit 基准。在多个 LLM 上的实验结果表明,我们的 ToxEdit 在解毒性能和保障 LLM 通用能力方面均优于先前最先进的方法。
引用
@article{arxiv.2505.22298,
title = {Adaptive Detoxification: Safeguarding General Capabilities of LLMs through Toxicity-Aware Knowledge Editing},
author = {Yifan Lu and Jing Li and Yigeng Zhou and Yihui Zhang and Wenya Wang and Xiucheng Li and Meishan Zhang and Fangming Liu and Jun Yu and Min Zhang},
journal= {arXiv preprint arXiv:2505.22298},
year = {2025}
}
备注
ACL 2025 Findings