模型编辑的迷思:重新审视真实场景评估
计算与语言
2025-06-03 v5
摘要
尽管文献中报告了接近完美的结果,但模型编辑在真实应用中的有效性仍不清楚。为弥合这一差距,我们引入了 QAEdit,一个与广泛使用的问答(QA)数据集对齐的新基准,以及 WILD,一个旨在更好地反映模型编辑真实使用的任务无关评估框架。我们的单次编辑实验表明,当前编辑方法的实际表现远低于先前报告的水平(38.5% vs. 96.8%)。我们证明这源于先前工作中合成评估实践的问题。其中最严重的是测试时使用教师强制,它同时泄露了真实标签的内容和长度,导致性能被高估。此外,我们通过顺序编辑模拟实际部署,揭示当前方法在仅进行 1000 次编辑后便急剧失效。本研究呼吁模型编辑研究向严谨评估转变,并开发能够可靠更新大语言模型知识的鲁棒、可扩展方法,以适用于真实场景。
引用
@article{arxiv.2502.11177,
title = {The Mirage of Model Editing: Revisiting Evaluation in the Wild},
author = {Wanli Yang and Fei Sun and Jiajun Tan and Xinyu Ma and Qi Cao and Dawei Yin and Huawei Shen and Xueqi Cheng},
journal= {arXiv preprint arXiv:2502.11177},
year = {2025}
}
备注
Accepted to ACL 2025 Main Conference (Camera Ready Version)