obliviate 的极限:基于刺激-知识 entangled-行为框架评估 LLM 中的遗忘
计算与语言
2025-10-30 v1 人工智能
摘要
大型语言模型(LLMs)中的遗忘对于管理敏感数据和纠正误information 至关重要,但其有效性的评估仍是开放问题。我们调查说服性提示是否能从被故意遗忘的 LLMs 中召回事实知识,模型规模从2.7B到13B(OPT-2.7B、LLaMA-2-7B、LLaMA-3.1-8B、LLaMA-2-13B)。drawing from ACT-R 和 Hebbian 理论(扩散激活理论),以及通信原则,我们引入刺激-知识 entangled-行为框架(SKeB),该框架通过 domain graphs 模型信息 entangled,并测试事实召回在遗忘模型中是否与说服性 framing 相关。我们开发了 entangled 指标来量化知识激活模式,并评估 factuality、non-factuality 和幻觉在输出中的情况。我们的结果表明,说服性提示显著增强了事实知识召回(14.8% baseline vs. 24.5% with authority framing),其有效性与模型规模呈反相关(2.7B 中的 128% recovery vs. 13B 中的 15%)。SKeB 为评估 LLMs 中的遗忘完整性、robustness 和 overall behavior 提供了基础。
关键词
引用
@article{arxiv.2510.25732,
title = {The Limits of Obliviate: Evaluating Unlearning in LLMs via Stimulus-Knowledge Entanglement-Behavior Framework},
author = {Aakriti Shah and Thai Le},
journal= {arXiv preprint arXiv:2510.25732},
year = {2025}
}
备注
14 pages, 11 figures