LLM 中的编辑追踪与撤销
计算与语言
2026-03-02 v2
摘要
知识编辑方法 (KEs) 是更新大语言模型 (LLMs) 事实内容的成本高效的方式,但它们具有双重用途风险。尽管 KEs 有利于更新过时或错误的信息,但它们也可能被恶意利用以植入错误信息或偏见。为了防御此类恶意操纵,我们需要能够可靠检测、解释和缓解恶意编辑的稳健技术。为此,我们引入了追踪与撤销编辑的任务。我们提出了一种仅基于修改后的权重来推断被编辑对象实体的新方法,无需访问编辑提示或任何其他语义相似的提示,准确率高达 99%。此外,我们提出了一种有效的、无需训练的编辑撤销方法。该方法可撤销高达 94% 的编辑,并在不获取任何关于编辑信息的情况下帮助恢复原始模型的输出分布。该方法可进一步改造用于区分已编辑与未编辑的权重。我们的发现突显了基于已编辑权重进行编辑追踪与撤销的可行性,为保护 LLM 免受对抗性操纵开辟了新的研究方向。
引用
@article{arxiv.2505.20819,
title = {Tracing and Reversing Edits in LLMs},
author = {Paul Youssef and Zhixue Zhao and Christin Seifert and Jörg Schlötterer},
journal= {arXiv preprint arXiv:2505.20819},
year = {2026}
}
备注
Accepted at ICLR 2026