中文

排他性遗忘

计算与语言 2026-04-08 v1

摘要

在将大型语言模型(LLMs)引入医疗和教育等工业应用时,生成有害内容的风险成为一个重大挑战。虽然现有的机器遗忘方法可以擦除特定的有害知识和表达,但多样化的有害内容使得全面移除变得困难。在这项研究中,我们没有逐一列出遗忘目标,而是提出了排他性遗忘(EU),旨在通过广泛遗忘除我们希望保留的知识和表达之外的一切来实现广泛的有害移除。我们证明,通过排他性遗忘,可以获得一个确保对广泛输入(包括越狱攻击)具有安全性的模型,同时保持对医学和数学等特定领域多样化指令的响应能力。

关键词

引用

@article{arxiv.2604.06154,
  title  = {Exclusive Unlearning},
  author = {Mutsumi Sasaki and Kouta Nakayama and Yusuke Miyao and Yohei Oseki and Masaru Isonuma},
  journal= {arXiv preprint arXiv:2604.06154},
  year   = {2026}
}