中文

基于参数知识痕迹的无学习内在测试

计算与语言 2025-09-03 v3 人工智能

摘要

大语言模型 (LLM) 中“取消学习”某些概念的任务最近因其重要性而受到广泛关注,这对于减轻不希望出现的模型行为至关重要,例如生成有害、私人或不正确的信息。当前用于评估取消学习方法的协议主要依赖行为测试,而不监控模型参数中未学习知识的存在。这种残余知识可能被对抗性地利用,以在取消学习后恢复被擦除的信息。我们认为,取消学习也应在内部评估,通过考虑未学习概念的参数知识痕迹的变化来实现。为此,我们提出了一种通用的评估方法,该方法利用词汇表投影来检查模型参数中编码的概念。我们使用该方法局部化“概念向量”——编码具体概念的参数向量——并构建 ConceptVectors,包含数百个常见概念及其在两个开源 LLM 中的参数知识痕迹。ConceptVectors 上的评估显示,现有的取消学习方法对概念向量的影响最小,主要在推理期间抑制它们,而直接削减这些向量则显著移除相关知识并显著降低模型对对抗性操纵的敏感性。我们的结果凸显了基于行为的取消学习评估的局限性,并呼吁未来的工作包括参数基于评估。为支持这一目标,我们发布了代码和基准:https://github.com/yihuaihong/ConceptVectors。

关键词

引用

@article{arxiv.2406.11614,
  title  = {Intrinsic Test of Unlearning Using Parametric Knowledge Traces},
  author = {Yihuai Hong and Lei Yu and Haiqin Yang and Shauli Ravfogel and Mor Geva},
  journal= {arXiv preprint arXiv:2406.11614},
  year   = {2025}
}

备注

Accepted in EMNLP 2025 Main