中文

Transformer中的表示破碎:基于知识编辑的合成研究

机器学习 2025-06-12 v5

摘要

知识编辑(KE)算法修改模型的权重,以对不正确、过时或其他不需要的事实关联进行有针对性的更新。然而,最近的研究表明,应用KE会对模型更广泛的事实回忆准确性产生不利影响,并削弱其推理能力。尽管这些研究提供了对KE算法潜在危害的见解,例如在基准测试上的性能评估,但对于为何会发生这种破坏性失败,我们知之甚少。受此启发,我们定义了一个新颖的合成任务,其中从头开始训练一个Transformer以内化一个“结构化”知识图谱。该结构强制了图谱中实体之间的关系,使得编辑一个事实关联会对其他实体产生“涓滴效应”(例如,将X的父母是Y改为Z会影响X的兄弟姐妹的父母是谁)。通过在此任务上评估编辑后的模型,我们表明KE无意中影响了超出目标实体的表示,扭曲了允许模型推断关于实体的未知知识的相关结构。我们将这种现象称为表示破碎,并证明它会降低模型的事实回忆和推理性能。我们还在自然环境中使用预训练的Llama和Mamba模型进一步证实了我们的发现。总的来说,我们的工作提出了一个精确的机制性假设来解释为什么KE会对模型能力产生不利影响。

关键词

引用

@article{arxiv.2410.17194,
  title  = {Representation Shattering in Transformers: A Synthetic Study with Knowledge Editing},
  author = {Kento Nishi and Rahul Ramesh and Maya Okawa and Mikail Khona and Hidenori Tanaka and Ekdeep Singh Lubana},
  journal= {arXiv preprint arXiv:2410.17194},
  year   = {2025}
}

备注

Accepted to ICML 2025