模型编辑建在沙子上?揭示其虚幻成功与脆弱基础
人工智能
2025-10-02 v1
摘要
大语言模型(LLM)不可避免地编码了过时或错误的知识。更新、删除和遗忘此类知识对于对齐、安全等问题至关重要。为此,模型编辑已成为一种有前景的范式:通过精确编辑小部分参数,以更新特定事实同时保留其他知识。尽管先前论文报道了其巨大成功,但我们发现编辑的表明可靠性建立在脆弱基础之上,当前文献在很大程度上由虚幻成功驱动。引导模型输出导向目标并以最小修改实现此目标的根本目标,会促使利用隐藏捷径,而非利用真实语义。这一问题直接挑战了当前模型编辑文献的可行性,因为捷径本质上与稳健的知识整合存在冲突。巧合的是,这一问题长期被缺乏负面样本设计的评估框架所掩盖。为揭示它,我们系统开发了一套新评估方法。惊人之处在于,最先进的方法即便在最简单的否定查询下也崩溃。我们的实证证据表明,编辑很可能基于捷径而非完整语义,这迫使我们在有意义地推进之前必须重新考虑模型编辑的根本基础。
引用
@article{arxiv.2510.00625,
title = {Is Model Editing Built on Sand? Revealing Its Illusory Success and Fragile Foundation},
author = {Wei Liu and Haomei Xu and Bingqing Liu and Zhiying Deng and Haozhao Wang and Jun Wang and Ruixuan Li and Yee Whye Teh and Wee Sun Lee},
journal= {arXiv preprint arXiv:2510.00625},
year = {2025}
}
备注
This is a work in progress. Comments and suggestions are welcome