探索大语言模型中基于模型编辑的忘卸技术
计算与语言
2025-12-25 v1
摘要
机器忘卸旨在从模型中移除不需要的信息,但许多方法在参数数量庞大的大语言模型上效率低下,或无法完全移除预期信息而不损害应保留的知识。模型编辑算法解决了类似问题,即改变模型中的信息,但它们关注的是将输入重定向到新目标,而非完全移除该信息。本文我们探索了 ROME、IKE 和 WISE 三种编辑算法,并为忘卸场景设计了新的编辑目标。通过这一调查,我们表明模型编辑方法在忘卸质量方面能够超过基线忘卸方法。类似于传统忘卸技术,它们在无需损害整体模型性能的情况下,难以完整刻画要被忘卸的范围。
引用
@article{arxiv.2512.20794,
title = {Investigating Model Editing for Unlearning in Large Language Models},
author = {Shariqah Hossain and Lalana Kagal},
journal= {arXiv preprint arXiv:2512.20794},
year = {2025}
}