无需专家精选数据集的大语言模型无学习方法
计算与语言
2025-10-08 v3 人工智能
机器学习
摘要
现代大型语言模型常常编码了敏感、有害或受版权保护的知识,导致需要后处理无学习——即能够从模型中去除特定领域知识的能力,而无需进行完整 retraining。当前无学习管道的一个主要瓶颈是构建有效的忘记集——数据集,近似目标领域并指导模型忘记它。在本工作中,我们引入了一种可扩展、自动化的方法,用于生成高质量的忘记集,方法是使用语言模型本身。我们的method通过结构化提示管道综合教科书式数据,只需输入领域名称。通过在无学习生物安全、网络安全和哈利波特小说方面的实验,我们显示,合成数据集持续优于基线合成替代方案,并且与专家精选数据集相当。此外,ablation 研究揭示,多步骤生成管道显著提升数据多样性,从而改善无学习实用性。总体而言,我们的发现表明,合成数据集为在无需手动干预的情况下为广泛的新兴领域实现实用、可扩展的无学习提供了可前景的道路。我们在 https://github.com/xyzhu123/Synthetic_Textbook 上发布了代码和数据集。
引用
@article{arxiv.2508.06595,
title = {LLM Unlearning Without an Expert Curated Dataset},
author = {Xiaoyuan Zhu and Muru Zhang and Ollie Liu and Robin Jia and Willie Neiswanger},
journal= {arXiv preprint arXiv:2508.06595},
year = {2025}
}