不可忘记还是混淆?通过良性再学习驭服忘却后的大语言模型记忆
机器学习
2025-03-18 v4
摘要
机器不可忘记是缓解ML模型训练数据不希望记忆的有前景的方法。然而,本文指出,现有针对大语言模型(LLM)的不可忘记方法竟然高度易受简单的一组“良性再学习攻击”的影响。我们仅通过访问小规模且可能松散关联的数据集,便能“驭服”不可忘记模型的记忆,以逆转不可忘记的效果。例如,我们展示了在公共医学文章上进行再学习可使不可忘记的LLM输出有关生物武器的有害知识,而在哈利·波特系列图书资料上进行再学习则可使模型逐字输出被记忆的文本。我们正式化了这种不可忘记-再学习管线,横跨三类主流不可忘记基准测试,讨论由此产生的未来方向与指南。我们的工作表明,当前的近似不可忘记方法仅仅是压制模型输出,未能在大语言模型中稳健地忘却目标知识。
引用
@article{arxiv.2406.13356,
title = {Unlearning or Obfuscating? Jogging the Memory of Unlearned LLMs via Benign Relearning},
author = {Shengyuan Hu and Yiwei Fu and Zhiwei Steven Wu and Virginia Smith},
journal= {arXiv preprint arXiv:2406.13356},
year = {2025}
}
备注
ICLR 2025, 32 pages, 8 figures, 9 tables