擦除还是隐藏?抑制虚假忘却神经元以实现稳健忘却
计算机视觉与模式识别
2025-11-12 v2
摘要
在 web 规模数据上训练的大语言模型会记忆私人或敏感知识,引发显著隐私风险。虽然一些忘却方法缓解了这些风险,但在后续训练期间仍然容易出现“重新学习”,导致被遗忘的知识大量浮现。本文表明,广泛使用的忘却方法会导致浅层对齐:它们并非忠实地擦除目标知识,而是生成放大负面影响以隐藏其作用的虚假忘却神经元。为克服这一局限,我们引入 Ssiuu,一种新的忘却方法类,采用归因导向的正则化以防止虚假负面影响,忠实地移除目标知识。实验结果表明,我们的方法可靠地擦除目标知识,并在两个实际再训练场景中超越强大基线:(1) 私人数据的对抗性注入;(2) 使用指令遵循基准测试的善意攻击。我们的发现凸显了在语言模型安全部署中实现稳健且忠实忘却方法的必要性。
引用
@article{arxiv.2509.22262,
title = {UniMapGen: A Generative Framework for Large-Scale Map Construction from Multi-modal Data},
author = {Yujian Yuan and Changjie Wu and Xinyuan Chang and Sijin Wang and Hang Zhang and Shiyi Liang and Shuang Zeng and Mu Xu and Ning Guo},
journal= {arXiv preprint arXiv:2509.22262},
year = {2025}
}
备注
AAAI2026 Oral