中文

REBEL:基于演化评估环路的隐藏知识恢复

机器学习 2026-02-09 v1 人工智能

摘要

机器学习方法旨在从训练好的大型语言模型中移除敏感或受版权保护的数据。然而,当前方法的实际效果仍不明确。标准评估指标依赖于良性查询,常常将表面信息抑制误认为真正的知识移除。此类指标无法检测更复杂提示策略仍可提取的残余知识。我们提出 REBEL,一种用于对抗性提示生成的演化方法,旨在探测是否仍可恢复被遗忘的数据。我们的实验表明,REBEL 成功从在标准遗忘基准测试中似乎已被遗忘的模型中诱发“被遗忘”知识,揭示当前遗忘方法可能仅提供表面的保护层。我们在 TOFU 和 WMDP 数据集的子集上验证了该框架,评估了多样化的遗忘算法。我们的实验显示,REBEL 在对抗性基线中持续优于静态基线,在 TOFU 上可实现最高达 60% 的攻击成功率 (ASR),在 WMDP 上可达 93%。我们将在接受后公开所有代码。代码地址为 https://github.com/patryk-rybak/REBEL/

关键词

引用

@article{arxiv.2602.06248,
  title  = {REBEL: Hidden Knowledge Recovery via Evolutionary-Based Evaluation Loop},
  author = {Patryk Rybak and Paweł Batorski and Paul Swoboda and Przemysław Spurek},
  journal= {arXiv preprint arXiv:2602.06248},
  year   = {2026}
}