中文

CodeUnlearn:基于离散概念的语言模型 amortized 零样本机器忘却

计算与语言 2024-10-16 v1 人工智能

摘要

大型语言模型(LLM)涵盖了 various 领域的广泛知识,但它们可能无意中记忆敏感的、未经授权的或恶意的数据,例如医疗和金融领域的个人信息。机器忘却方法旨在训练后删除特定信息以解决这一问题。然而,当前方法需要额外的模型训练或由于 LLM 的复杂、稠密且连续的本质,难以有效擦除特定数据点及其相关上下文。在本研究中,我们提出了一种新颖的 amortized 忘却方法,使用码本特征和稀疏自编码器(SAE)。通过利用瓶颈来分解激活空间并调节信息流,我们的方法能够高效地忘却目标信息,同时保留模型在无关数据上的性能。迄今为止,这是首个成功在 LLM 中实现忘却具有上下文相关性的特定主题的工作,标志着机器忘却向实际应用迈出了重要一步。

关键词

引用

@article{arxiv.2410.10866,
  title  = {CodeUnlearn: Amortized Zero-Shot Machine Unlearning in Language Models Using Discrete Concept},
  author = {YuXuan Wu and Bonaventure F. P. Dossou and Dianbo Liu},
  journal= {arXiv preprint arXiv:2410.10866},
  year   = {2024}
}