中文

LLM 是否真的忘记了?基于知识相关性与自信度 awareness 的 unlearning 评估

计算与语言 2025-10-23 v4 机器学习

摘要

机器 unlearning 技术旨在缓解大型语言模型(LLM)中意外记忆的問題。然而, 現有的做法主要聚焦於對孤立事實的明確移除, 常常忽視潛在的推論依賴以及 LLM 中知識的非確定性。結果, 被認為已忘記的事實可能透過相關信息潛伏。為此, 本文提出一個知識 unlearning 評估框架, 以更準確地捕捉現實知識的隱式結構, 將相關事實上下文表示為帶置信度分數的知識圖。我們進一步發展了一種基於推理的評估協議, 使用強大的 LLM 作為審判官; 這些審判官對提取的知識子圖進行推理以確定 unlearning 成功與否。我們的 LLM 審判官利用精心設計的提示詞, 並對人類評估進行校準以確保其可信度和穩定性。對我們新構建的基準進行大量實驗, 表明本框架提供了更真實且嚴格的 unlearning 性能評估。此外, 我們的發現揭示了當前評估策略傾向於高估 unlearning 效果。我們的程式碼已公開於 https://github.com/Graph-COM/Knowledge_Unlearning.git。

关键词

引用

@article{arxiv.2506.05735,
  title  = {Do LLMs Really Forget? Evaluating Unlearning with Knowledge Correlation and Confidence Awareness},
  author = {Rongzhe Wei and Peizhi Niu and Hans Hao-Hsun Hsu and Ruihan Wu and Haoteng Yin and Mohsen Ghassemi and Yifan Li and Vamsi K. Potluru and Eli Chien and Kamalika Chaudhuri and Olgica Milenkovic and Pan Li},
  journal= {arXiv preprint arXiv:2506.05735},
  year   = {2025}
}

备注

NeurIPS Camera-Ready Version. Code available at: https://github.com/Graph-COM/Knowledge_Unlearning