如何让大语言模型忘记:关于反转类内知识编辑的研究
计算与语言
2025-04-11 v3
摘要
类内知识编辑(IKE)通过无需参数更改且成本为零的方式,使大语言模型(LLM)输出能够被高效修改。然而,它可能被滥用,以隐蔽方式操控响应,例如插入错误信息或冒犯性内容。此类恶意干预可能被整合到高级封装 API 中,其中最终输入提示不会显示给最终用户。为解决此问题,我们研究了 IKE 编辑的检测与反转。首先,我们展示了即使在黑盒设置下(例如,具有有限输出信息的专有 LLM),仅通过前 10 个输出概率即可以高准确率(F1 > 80%)检测 IKE 编辑。进一步,我们提出了使用专门调谋的反转标记来反转 IKE 编辑的新任务。我们探索了使用连续反转标记和离散反转标记,实现了在多个 LLM 上恢复原始未编辑输出的准确率超过 80%。我们的连续反转标记尤其有效,对未编辑提示几乎没有影响。通过分析输出分布、注意力模式和标记排序,我们提供了对 IKE 对 LLM 影响以及如何通过反转标记缓解其作用的见解。该工作代表了提高大语言模型抗滥用性的重要一步,增强了其透明度和可信度。
引用
@article{arxiv.2410.12586,
title = {How to Make LLMs Forget: On Reversing In-Context Knowledge Edits},
author = {Paul Youssef and Zhixue Zhao and Jörg Schlötterer and Christin Seifert},
journal= {arXiv preprint arXiv:2410.12586},
year = {2025}
}
备注
Accepted at NAACL Main 2025