LLM鲁棒无学习的可分离性度量——SEPS
计算与语言
2025-05-28 v2
摘要
机器无学习旨在从大语言模型(LLM)中 selectively 删除指定知识,确保其忘记指定内容同时保留essential信息。现有无学习指标评估模型是否正确回答保留查询并拒绝忘记查询,但未能捕捉实际场景中忘记查询较少孤立出现的情形。事实上,忘记查询和保留查询经常存在于同一提示中,使得混合查询评估至关重要。我们提出SEPS(Separability Measure for Robust Unlearning),一种显式衡量模型在单个提示中同时忘记和保留信息能力的评估框架。通过针对三个基准进行大量实验,我们确定了现有无学习方法的两个关键失效模式:(1)非针对性无学习不加区分地擦除一旦出现忘记查询即会擦除的内容和保留内容;(2)针对性无学习过度拟合单查询场景,在处理多个查询时会导致灾难性失败。为解决这些问题,我们提出混合提示(Mixed Prompt, MP)无学习策略,将忘记查询和保留查询整合到统一的训练目标中。我们的做法显著提高了无学习效果,在包含最多八个混合忘记和保留查询的单个提示中的复杂场景中实现了鲁棒性。
引用
@article{arxiv.2505.14832,
title = {SEPS: A Separability Measure for Robust Unlearning in LLMs},
author = {Wonje Jeung and Sangyeon Yoon and Albert No},
journal= {arXiv preprint arXiv:2505.14832},
year = {2025}
}
备注
32 pages