中文

超越数据过滤:LLM中知识局部化的能力移除

机器学习 2025-12-08 v1

摘要

大型语言模型日益具备携带双刃剑风险的能力。虽然数据过滤作为一种在预训练期间的缓解措施,但面临着显著挑战:标记数据是否具有危险性在大规模下昂贵且困难,鉴于更大模型的样本效率不断提高,即使少量误标记的内容也可能引发危险能力。为解决误标记有害内容相关的风险, prior work 提出了梯度路由(Cloud等,2024)——一种将目标知识局部化到模型特定参数子集的技术,以便稍后进行移除。我们探索了一种改进版的梯度路由,称为选择性梯度遮蔽(SGTM),重点评估其对标签噪声的鲁棒性。SGTM通过对选定梯度进行零遮蔽,使目标领域示例仅更新其专用参数。我们在两个应用中测试了SGTM的有效性:一个是在双语合成数据集上移除一种语言知识,另一个是在英语维基百科上移除生物学知识。在两种情况下,SGTM在标签错误存在的情况下,在保留/遗忘权衡方面优于数据过滤和之前提出的梯度路由的一种实例。与可以通过微调快速逆转的浅层无学习方法不同,SGTM对对抗性微调表现出强大的鲁棒性,需要七倍的微调步骤才能在遗忘集合上达到基线性能。我们的结果表明,SGTM为现有安全缓解措施提供了一种具有前景的预训练期间补充,特别是在标签噪声不可避免的情境下。

关键词

引用

@article{arxiv.2512.05648,
  title  = {Beyond Data Filtering: Knowledge Localization for Capability Removal in LLMs},
  author = {Igor Shilov and Alex Cloud and Aryo Pradipta Gema and Jacob Goldman-Wetzler and Nina Panickssery and Henry Sleight and Erik Jones and Cem Anil},
  journal= {arXiv preprint arXiv:2512.05648},
  year   = {2025}
}