中文

模型编辑的蝴蝶效应:少量编辑即可触发大语言模型崩溃

人工智能 2024-06-06 v4

摘要

尽管模型编辑在修正大语言模型(LLM)中的知识方面显示出前景,但其对 LLM 固有能力的影響往往被忽视。在这项工作中,我们揭示了一个关键现象:即使单次编辑也可能触发模型崩溃,表现为在各种基准任务中性能显著下降。然而,在每次编辑后对 LLM 进行基准测试虽然对于防止此类崩溃是必要的,但在时间和资源上都不切实际。为了缓解这一问题,我们提出使用困惑度作为代理指标,大量实验验证了编辑模型的困惑度变化与其下游任务性能 strongly correlated。我们进一步对顺序编辑(现实场景中的实际设置)进行了深入研究,跨越各种编辑方法和 LLM,重点关注我们之前单次编辑研究中的困难案例。结果表明,几乎所有检查过的编辑方法在仅经过少量编辑后都会导致模型崩溃。为了促进进一步研究,我们利用 GPT-3.5 基于这些困难案例开发了一个新数据集 HardEdit。该数据集旨在为可靠的模型编辑研究和编辑诱导模型崩溃的潜在机制奠定基础。我们希望这项工作能引起社区对模型编辑实践中固有潜在风险的关注。

关键词

引用

@article{arxiv.2402.09656,
  title  = {The Butterfly Effect of Model Editing: Few Edits Can Trigger Large Language Models Collapse},
  author = {Wanli Yang and Fei Sun and Xinyu Ma and Xun Liu and Dawei Yin and Xueqi Cheng},
  journal= {arXiv preprint arXiv:2402.09656},
  year   = {2024}
}

备注

Accepted at Findings of ACL 2024