中文

基于自构建知识三元组的大型语言模型概念遗忘

计算与语言 2025-09-22 v1 机器学习

摘要

机器遗忘(MU)近期因解决大型语言模型(LLM)中的隐私与版权问题而受到广泛关注。现有 MU 方法旨在最小化对无关知识的影响的同时删除特定目标句子,但这些方法需要明确的目标句子,无法支持删除更广泛的概念,如人物或事件。为此,本文提出概念遗忘(CU)作为 LLM 遗忘的新型需求。我们利用知识图谱表示 LLM 的内部知识,将 CU 定义为删除遗忘目标节点及其关联边。这种图结构化表述方式使遗忘过程更直观,并促进了更有效方法的设计。我们提出一种新方法,引导 LLM 生成知识三元组及关于遗忘目标的解释性句子,并将遗忘过程应用于这些表征。该方法通过与 LLM 内部知识表征对齐,实现了对概念层面的精准与全面遗忘。在真实数据集与人工合成数据集上的实验表明,我们的方法有效实现了概念级遗忘,同时保留了无关知识。

关键词

引用

@article{arxiv.2509.15621,
  title  = {Concept Unlearning in Large Language Models via Self-Constructed Knowledge Triplets},
  author = {Tomoya Yamashita and Yuuki Yamanaka and Masanori Yamada and Takayuki Miura and Toshiki Shibahara and Tomoharu Iwata},
  journal= {arXiv preprint arXiv:2509.15621},
  year   = {2025}
}