中文

文本忘却制造了虚假的忘却感

密码学与安全 2025-06-11 v3 人工智能 计算与语言 机器学习

摘要

语言模型(LM)容易“记忆”训练数据,包括大量敏感用户信息。为缓解隐私风险并保障被遗忘权利,机器忘却已成为有效方法,使 LM 能“高效忘却”特定文本。然而,尽管意图良好,文本忘却是否真正如此有效可靠?为回答此问,我们首先提出 Unlearning Likelihood Ratio Attack+(U-LiRA+),一种严格的文本忘却审计方法,发现忘却后的文本仍可被极高置信度检测。进一步,我们深入调查文本忘却机制在部署中的隐私风险,提出 Textual Unlearning Leakage Attack(TULA),及其在黑盒与白盒情境下的变体。我们表明文本忘却机制可能反而透露更多关于被忘却文本的信息,使其暴露于显著的成员推断和数据重构风险。我们的发现表明现有的文本忘却实际上制造了虚假的忘却感,凸显需更稳健安全的忘却机制的需求。

关键词

引用

@article{arxiv.2406.13348,
  title  = {Textual Unlearning Gives a False Sense of Unlearning},
  author = {Jiacheng Du and Zhibo Wang and Jie Zhang and Xiaoyi Pang and Jiahui Hu and Kui Ren},
  journal= {arXiv preprint arXiv:2406.13348},
  year   = {2025}
}