FROC:面向 LLM 机器遗忘的统一框架与风险优化控制
机器学习
2025-12-16 v1
摘要
机器遗忘(MU)旨在消除已部署模型中特定训练样本的影响。随着大语言模型(LLM)的广泛应用,管理因遗忘不充分或效用损失而产生的风险日益关键。当前的 MU 技术缺乏评估与控制这些风险的有效机制,阻碍了对能适当平衡安全性与效用之策略的选择,并引发了围绕“被遗忘权”的信任担忧。为解决这些问题,我们提出了 FROC,一个面向 LLM 机器遗忘的统一框架与风险优化控制。FROC 围绕一种保形风格的风险控制公式构建,该公式表达了用户对遗忘行为指定的风险预算。这一基于概率的约束使 FROC 能够比较 MU 策略、识别可行的工作区域,并根据遗忘充分性与效用保留之间的预期权衡来指导超参数选择。为使该约束可操作化,FROC 引入了一个平滑变化的连续风险模型,将遗忘不足与效用退化聚合为单一的配置级分数。基于保形风险分析,FROC 计算了:(1)保形遗忘风险(CUR),一个关于被遗忘样本继续影响模型预测之概率的数据驱动估计值;以及(2)风险控制配置集,用于识别在指定风险预算下有效的遗忘超参数。在多种 LLM MU 方法上的实验表明,FROC 产生了稳定、可解释的风险态势,并揭示了遗忘配置、语义偏移与效用影响之间的一致关系。FROC 将 MU 重构为一个可控、风险感知的过程,并为管理大规模 LLM 部署中的遗忘行为提供了实用基础。
引用
@article{arxiv.2512.13337,
title = {FROC: A Unified Framework with Risk-Optimized Control for Machine Unlearning in LLMs},
author = {Si Qi Goh and Yongsen Zheng and Ziyao Liu and Sami Hormi and Kwok-Yan Lam},
journal= {arXiv preprint arXiv:2512.13337},
year = {2025}
}