中文

理解模型编辑中大语言模型的崩溃

计算与语言 2024-10-01 v2 人工智能

摘要

尽管模型编辑方法取得了显著进展,但它们在现实场景中的应用仍然具有挑战性,因为它们常常导致大型语言模型(LLM)崩溃。其中,ROME尤其令人担忧,因为它可能仅通过一次编辑就破坏LLM。在本文中,我们研究了这种崩溃的根本原因。通过广泛分析,我们确定了导致崩溃的两个主要因素:i) 参数更新方程中对带前缀和不带前缀键的不一致处理可能导致分母非常小,从而引起过大的参数更新;ii) 崩溃案例的主体通常是第一个词元,其不带前缀的键分布在自回归Transformer中与带前缀的键分布显著不同,导致上述问题具体化。为了验证我们的发现,我们提出了一种简单而有效的方法:在编辑阶段统一使用带前缀的键,并在测试阶段添加前缀,以确保训练和测试之间的一致性。实验结果表明,所提出的解决方案可以在保持编辑有效性的同时防止模型崩溃。

关键词

引用

@article{arxiv.2406.11263,
  title  = {Understanding the Collapse of LLMs in Model Editing},
  author = {Wanli Yang and Fei Sun and Jiajun Tan and Xinyu Ma and Du Su and Dawei Yin and Huawei Shen},
  journal= {arXiv preprint arXiv:2406.11263},
  year   = {2024}
}

备注

Accepted at Findings of EMNLP 2024 (Camera-Ready Version)