直接 token 优化:大型语言模型忘卸的自包含方法
计算与语言
2025-10-02 v1 人工智能
密码学与安全
摘要
机器忘卸是一种新兴技术,用于无需完全重新训练即可从模型中移除训练数据子集(忘却集)的影响,具有包括隐私保护、内容审查和模型纠正等应用。关键挑战在于确保模型完全忘卸忘却集的知识而不损害其整体实用性。现有的大型语言模型(LLM)忘卸方法通常利用辅助语言模型、保留数据集,甚至商业 AI 服务来有效忘卸并维持模型实用性。然而,这些外部资源的依赖往往是不切实际的,并且可能潜在地引入额外的隐私风险。在本工作中,我们提出了直接 token 优化(DTO),这是一种用于 LLM 的新型自包含忘卸方法,直接优化 token 级别目标,无需外部资源。给定一个要忘卸的序列,我们识别出两种类别的 token:目标 token,这些 token 捕获关键的忘卸知识;以及剩余的非目标 token,这些 token 对维持模型实用性至关重要。前者用于优化忘卸目标,而后者用于保持模型性能。实验结果表明,所提出的 DTO 在多个基准数据集上比最新的基线方法在忘卸质量方面实现了最高可达 的提升,同时保持相当水平的模型实用性。
引用
@article{arxiv.2510.00125,
title = {Direct Token Optimization: A Self-contained Approach to Large Language Model Unlearning},
author = {Hong kyu Lee and Ruixuan Liu and Li Xiong},
journal= {arXiv preprint arXiv:2510.00125},
year = {2025}
}