中文

SemEval-2025 任务 4:SHA256 -- 通过知识隔离实现大型语言模型的选择性遗忘

计算与语言 2025-04-18 v1 人工智能

摘要

大型语言模型 (LLM) 在训练期间经常记忆敏感信息,部署到公开可访问的模型时会带来风险。当前的机器遗忘方法在不降低整体模型能力的前提下,难以选择性地删除特定数据关联。本文提出了解决 SemEval-2025 任务 4(针对性遗忘)的方案,采用两阶段方法结合因果中介分析与层级特定优化。通过对 OLMo 架构(1B 和 7B 参数)进行系统性因果追踪实验,我们确定前几层 transformer 层(0-5 层)在存储主体-属性关联中起关键作用。基于此洞察,我们开发了受约束的优化方法,冻结上层网络 while 对 lower layers 同时应用新型联合损失函数——通过输出 token 交叉熵惩罚最大化遗忘集合损失,通过自适应正则化最小化保留集合偏差。该方法在 1B 模型赛道中获得第二名,展示了在保持 88% 基线 MMLU 准确率的同时实现强劲任务性能。这些结果表明基于因果信息的层级优化是 LLM 高效、精确遗忘的有前景的范式,为解决 AI 系统中数据隐私问题提供了重要进展。

关键词

引用

@article{arxiv.2504.12996,
  title  = {SHA256 at SemEval-2025 Task 4: Selective Amnesia -- Constrained Unlearning for Large Language Models via Knowledge Isolation},
  author = {Saransh Agrawal and Kuan-Hao Huang},
  journal= {arXiv preprint arXiv:2504.12996},
  year   = {2025}
}

备注

8 pages, In Proceedings of The 19th International Workshop on Semantic Evaluation (SemEval), 2025