QUAIL:用于缓解 LLM 中错误信息的量化感知遗忘
机器学习
2026-01-23 v1 人工智能
摘要
机器遗忘旨在从已训练的模型中移除特定知识(如受版权保护或私有数据),而无需完全重新训练。在实践中,模型在部署时通常会被量化(例如 4-bit),但我们发现量化会灾难性地恢复被遗忘的信息 [1]。在本文中,我们(1)分析了低比特量化为何会破坏遗忘,并(2)提出了一种量化感知的遗忘方法来缓解这一问题。我们首先计算量化中的权重变化统计量和桶重叠,以表明典型的遗忘更新太小而无法跨越量化阈值。基于这一洞察,我们引入了 logits 空间铰链损失:对于每个遗忘样本,我们迫使遗忘模型的输出 logits 与原始模型至少相差一个边界(量化步长的一半)。这确保了被遗忘的样本在量化后仍然可区分。我们在语言和分类任务(包括一个 Twitter 错误信息数据集)上进行了评估,并表明我们的方法在 4-bit 量化下能保持遗忘效果,而现有方法几乎完全恢复了被遗忘的知识。
引用
@article{arxiv.2601.15538,
title = {QUAIL: Quantization Aware Unlearning for Mitigating Misinformation in LLMs},
author = {Himanshu Mishra and Kanwal Mehreen},
journal= {arXiv preprint arXiv:2601.15538},
year = {2026}
}