中文

通过模型合并实现大规模精确忘卸微调数据

机器学习 2025-04-08 v1

摘要

近年来,近似忘卸(approximate unlearning)作为一种高效更新 LLM 以使其行为(大致)仿佛从未训练于特定数据子集的技术受到广泛关注。然而,现有方法在实际应用中脆弱且易受攻击以揭示所谓忘卸的信息。为缓解近似忘卸的问题,本文提出了 SIFT-Masks(SIgn-Fixed Tuning-Masks),一种基于模型合并的精确忘卸方法。SIFT-Masks 解决了标准模型合并的两个关键限制:(1) 合并大量任务会严重损害效用;(2) 通过在任务之间共享额外信息来提升效用的技术会使精确忘卸计算开销居高不下。SIFT-Masks 通过 (1) 对局部掩码进行调制以恢复任务特定的性能;(2) 将微调限制在与全局符号向量对齐的范围内,以轻量级方式在合并前独立确定掩码。我们在合并最高多达 500 个模型的四个场景中表明,SIFT-Masks 在准确率上比朴素合并提高了 5-80%,且对其他合并基线进行的精确忘卸计算开销降低了最高可达 250 倍。

关键词

引用

@article{arxiv.2504.04626,
  title  = {Exact Unlearning of Finetuning Data via Model Merging at Scale},
  author = {Kevin Kuo and Amrith Setlur and Kartik Srinivas and Aditi Raghunathan and Virginia Smith},
  journal= {arXiv preprint arXiv:2504.04626},
  year   = {2025}
}

备注

9 pages, 10 figures