利用激活引导缓解大语言模型中的记忆现象
计算与语言
2025-03-11 v1
摘要
大语言模型(LLM)对训练数据的记忆会带来重大风险,包括隐私泄露和版权内容的复现。激活引导作为一种直接干预模型激活值的技术,已成为操纵 LLM 的一种极具前景的方法。在本研究中,我们探讨了激活引导在减少记忆现象的同时保持泛化能力的有效性。我们使用受控的文学材料记忆基准进行了实证评估,结果表明我们的方法成功抑制了 Gemma 中的记忆内容,且模型性能的下降微乎其微。此外,我们分析了抑制效果与语言流畅性之间的权衡,突出了基于激活的干预方法的优势与局限性。我们的研究通过提供一种实用且高效的机制来缓解非预期的记忆现象,为开发更安全、更具隐私保护性的 LLM 的持续努力做出了贡献。
引用
@article{arxiv.2503.06040,
title = {Mitigating Memorization in LLMs using Activation Steering},
author = {Manan Suri and Nishit Anand and Amisha Bhaskar},
journal= {arXiv preprint arXiv:2503.06040},
year = {2025}
}