UnUnlearning:先进生成式AI中的内容监管不仅仅是忘却
机器学习
2024-07-02 v1 人工智能
计算与语言
密码学与安全
摘要
Exact unlearning最初被引入作为一种隐私机制,允许用户请求从机器学习模型中撤回其数据。随后,提出了近似方案以缓解与精确忘却相关的不可实际成本。最近,忘却常被讨论用于移除不允许的知识,即模型不应具备的知识,如未经授权的版权内容、不准确或恶意信息。承诺是,如果模型不具备某种恶意能力,则无法用于相关恶意目的。在本文中,我们重新审视了将忘却用于大语言模型 (LLM) 的范式,并突出了由于in-context learning而产生的内在不一致。忘却在训练阶段可以是有效的控制机制,但在推理期间并不能防止模型执行不允许的行为。在本文中,我们引入了ununlearning的概念,即忘却的知识在in-context中被重新引入,实际上使模型能够像拥有被遗忘知识一样行为。结果表明,对于不允许的知识,内容过滤将是必需的,即使是精确忘却方案也不足以有效进行内容监管。我们讨论了现代LLM的ununlearning可行性并探讨了更广泛的影响。
关键词
引用
@article{arxiv.2407.00106,
title = {UnUnlearning: Unlearning is not sufficient for content regulation in advanced generative AI},
author = {Ilia Shumailov and Jamie Hayes and Eleni Triantafillou and Guillermo Ortiz-Jimenez and Nicolas Papernot and Matthew Jagielski and Itay Yona and Heidi Howard and Eugene Bagdasaryan},
journal= {arXiv preprint arXiv:2407.00106},
year = {2024}
}