通过电路归因实现量化永久遗忘:MANSU方法
机器学习
2026-05-15 v1 计算与语言
新兴技术
摘要
标准遗忘评估在训练后立即以全精度测量行为抑制,尽管每个部署的语言模型都首先进行量化。最近的工作表明,4位后训练量化可反转机器遗忘;我们指出这并非微调器件 artifacts,而是系统性双重失效:实现有意义遗忘的梯度方法在压缩下丢失其遗忘能力,而在量化中存活的方法几乎不改变模型。这两种失效均可归因于同一根本原因:所有基线方法中,参数级更新幅度仅为NF4量化bin宽度的47-828倍;跨数十亿参数的更新无法跨越量化bin边界,这一现象formalized为稀疏性-永久性权衡。我们提出MANSU(Mechanistic-Aligned Null-Space Unlearning),通过结合因果电路归因隔离最小遗忘子图、电路受限null空间投影以对角Fisher保留界以及保证量化存活的 per-parameter幅度下界来解决上述两种模式。我们还引入电路归因偏差(Circuit Attribution Divergence, CAD),一种机制验证指标,用于区分结构擦除与行为抑制,后者是现有指标无法区分的。跨多个模型家族和危害基准测试,MANSU是首个在每个属性上都具备边际优势的方法(有意义的遗忘、保留保持、非正PTQ gap以及结构擦除),而梯度基方法在压缩下可恢复最高+0.05的准确率。
引用
@article{arxiv.2605.15138,
title = {Forgetting That Sticks: Quantization-Permanent Unlearning via Circuit Attribution},
author = {Saisab Sadhu and Pratinav Seth and Vinay Kumar Sankarapu},
journal= {arXiv preprint arXiv:2605.15138},
year = {2026}
}