面向去污化的知识编辑鲁棒性研究
计算与语言
2026-02-12 v1
摘要
基于知识编辑 (KE-based) 的去污化方法日益成为缓解大语言模型中有害行为的有前景方法。然而,现有评估主要依赖自动去污分类器,隐含地假设降低的去污分数反映真正的行为抑制。在本工作中,我们提出了面向鲁棒性的评估框架,用于 KE-based 去污化,沿着三个维度考察其可靠性:优化鲁棒性、组合鲁棒性和跨语言鲁棒性。我们识别出一种常见的伪去污化失效模式,即显著的去污度降低源于退化生成行为,而非对不安全内容的真实抑制。我们进一步表明,当多个不安全行为被同时编辑时,去污化效果会下降;且单语种和跨语种去污化仅在特定模型-方法组合下才保持有效。总体而言,我们的结果表明,KE-based 去污化仅针对特定模型、有限数量的去污化目标以及语言子集时才具备鲁棒性。
引用
@article{arxiv.2602.10504,
title = {On the Robustness of Knowledge Editing for Detoxification},
author = {Ming Dong and Shiyi Tang and Ziyan Peng and Guanyi Chen and Tingting He},
journal= {arXiv preprint arXiv:2602.10504},
year = {2026}
}