通过自动对抗性提示探测目标化未遗忘大语言模型中的知识泄露
计算与语言
2025-05-26 v1 人工智能
密码学与安全
机器学习
摘要
本工作提出 LURK(Latent UnleaRned Knowledge),一个通过对抗后缀提示探测未遗忘 LLM 中隐藏保留知识的新框架。LURK 自动生成针对哈里·波特领域的对抗性提示后缀,以诱发残余知识。我们的实验表明,即便是被认为成功遗忘的模型在针对性对抗条件下也会泄露特定信息,这凸显了当前遗忘评估标准的关键局限性。通过间接探测发现潜在知识,LURK 提供了更严谨且诊断性的工具,用于评估遗忘算法的鲁棒性。所有代码将公开 disponible。
引用
@article{arxiv.2505.17160,
title = {Harry Potter is Still Here! Probing Knowledge Leakage in Targeted Unlearned Large Language Models via Automated Adversarial Prompting},
author = {Bang Trinh Tran To and Thai Le},
journal= {arXiv preprint arXiv:2505.17160},
year = {2025}
}