中文

面向机器遗忘的特征选择性表示误导

太阳与恒星天体物理 2025-12-19 v1

摘要

随着大型语言模型(LLMs)在安全关键和受监管领域的广泛采用,敏感或禁止知识的保留会引发从隐私泄露、合规性风险到潜在滥用等日益严重的威胁。最近的研究表明,机器遗忘有助于确保部署模型遵循不断变化的法律、安全和治理要求。然而,现有遗忘技术假设忘记数据集与保留数据集之间存在干净的分离,这在分布高度交织的运营环境中难以实现。在此类场景下,基于扰动的方法往往会损害通用模型实用性,或难以确保安全。为此,我们提出面向机器遗忘的选择性表示误导(SRMU),一种基于特征的结构化激活编辑框架,通过激活重要性图实现特征感知和方向性控制扰动。与不加区分的模型权重扰动不同,SRMU采用带有激活重要性图的结构化误导向量,旨在选择性抑制有害表示,同时保留良性表示的实用性。在广泛使用的WMDP基准上进行实验,涵盖低和高交织配置。实证结果表明,SRMU在最低实用性损失下实现了最先进的遗忘性能,并在20-30%的重叠率下保持有效,而现有基线方法则崩溃。SRMU为安全驱动的模型治理、隐私合规以及新兴LLM应用中的受控知识移除提供了稳健的基础。我们将发布复制软件包于https://figshare.com/s/d5931192a8824de26aff。

关键词

引用

@article{arxiv.2512.16296,
  title  = {Multi-Energy Proton Events and Geomagnetic Storms in Solar Cycles 23 and 24},
  author = {Rositsa Miteva and Susan W. Samwel and Svetoslav Zabunov},
  journal= {arXiv preprint arXiv:2512.16296},
  year   = {2025}
}