一种破坏大语言模型中记忆序列的轻量级方法
机器学习
2025-05-28 v2 计算与语言
摘要
随着语言模型规模的扩大,其在广泛任务上的性能显著提升,但逐字记忆和复述部分训练数据的倾向也随之增加。这种权衡带来了严重的法律、伦理和安全问题,尤其是在实际部署中。现有的缓解技术,如差分隐私或模型遗忘,通常需要重新训练或访问内部权重,这使得它们对大多数用户来说不切实际。在这项工作中,我们引入了 TokenSwap,一种轻量级的事后防御方法,专为用户只能访问词元级输出的现实场景而设计。我们的核心见解是,虽然大型模型对于高任务性能是必需的,但小型模型(例如 DistilGPT-2)通常足以为常见的功能词分配流畅、语法上合理的概率——而且至关重要的是,它们记忆的内容要少得多。通过有选择地在模型之间交换词元概率,TokenSwap 保留了大型模型的能力,同时降低了它们逐字复现的倾向。在 Pythia-6.9B 和 Llama-3-8B 上的评估显示,精确记忆量下降了高达 10 倍,而任务性能的下降可以忽略不计。我们的方法为缓解已部署大语言模型中的记忆生成问题提供了一种实用、可及的解决方案。
引用
@article{arxiv.2502.05159,
title = {A Lightweight Method to Disrupt Memorized Sequences in LLM},
author = {Parjanya Prajakta Prashant and Kaustubh Ponkshe and Babak Salimi},
journal= {arXiv preprint arXiv:2502.05159},
year = {2025}
}
备注
26 pages, 3 figures