从领域到实例:面向 LLM 无学习的双粒度数据合成
计算与语言
2026-04-21 v2 人工智能
密码学与安全
机器学习
摘要
尽管机器无学习对于从大型语言模型(LLM)中移除私人、有害或受版权保护的内容至关重要,但当前基准往往未能忠实代表模型所学习的真实 '忘却范围'。我们正式定义两种不同的无学习粒度:领域级与实例级,并提出 \BiForget——一个自动化框架,用于合成高质量忘却数据集。不同于依赖外部生成器的先前方法,\BiForget 利用目标模型本身通过基于种子引导和对抗性提示,从而引导数据匹配其内部知识分布。我们的实验在多样化基准上表明,该方法在相关性、多样性和效率方面实现了优异平衡。定量而言,在哈利波特领域,相关性提升约20%,多样性提升约0.05,而数据总量减半。最终,该方法促进更稳健的忘却,实现更好的实用性保留,为评估 LLM 无学习提供更严谨的基础。
引用
@article{arxiv.2601.04278,
title = {From Domains to Instances: Dual-Granularity Data Synthesis for LLM Unlearning},
author = {Xiaoyu Xu and Minxin Du and Zitong Li and Zi Liang and Zhibiao Guo and Shiyu Zhang and Peizhao Hu and Qingqing Ye and Haibo Hu},
journal= {arXiv preprint arXiv:2601.04278},
year = {2026}
}
备注
ACL 2026 (Findings), accepted to appear