中文

学习时间编码塑造 LLM 中的非学习

计算与语言 2025-06-19 v1 机器学习

摘要

随着大型语言模型(LLM)在实际中日益广泛部署,不断后处理地移除特定知识的能力变得至关重要,这种能力因涉及隐私法规、纠正过时或有害内容等原因而至为重要。先前的工作提出了非学习基准和算法,通常假设训练过程和目标模型是固定的。在本工作中,我们实证研究学习时间选择如何影响事实知识非学习的有效性。我们的实验揭示了两个关键发现:(1)通过改写描述学习可提高非学习性能;(2)从块状文本中逐个知识进行非学习具有挑战性。我们的结果表明,学习时间的知识编码可能在实现可靠的事后非学习方面起中心作用。

关键词

引用

@article{arxiv.2506.15076,
  title  = {Learning-Time Encoding Shapes Unlearning in LLMs},
  author = {Ruihan Wu and Konstantin Garov and Kamalika Chaudhuri},
  journal= {arXiv preprint arXiv:2506.15076},
  year   = {2025}
}