STaR:大型推理模型机器遗忘的敏感轨迹调节
人工智能
2026-01-15 v1
摘要
大型推理模型推进了自动多步推理,但其生成复杂思维链轨迹的能力引入了严重的隐私风险,因为敏感信息可能深度嵌入在整个推理过程中。现有的大型语言模型机器遗忘方法通常仅关注修改最终答案,这对于大型推理模型是不充分的,因为它们无法移除中间步骤中的敏感内容,导致持续的隐私泄露和安全性下降。为了应对这些挑战,我们提出了敏感轨迹调节,这是一个无参数的推理时机器遗忘框架,能够在整个推理过程中实现稳健的隐私保护。具体而言,我们首先通过语义感知检测识别敏感内容。然后,我们通过安全提示前缀注入全局安全约束。接着,我们执行轨迹感知抑制,以动态阻断整个推理链上的敏感内容。最后,我们应用 token 级自适应过滤,以在生成过程中防止精确和改写的敏感 token。此外,为了克服现有评估协议的不足,我们引入了两个指标:多解码一致性评估,用于衡量不同解码策略间机器遗忘的一致性;以及多粒度成员推理攻击评估,用于在答案和推理链两个层面量化隐私保护。在 R-TOFU 基准上的实验表明,STaR 以最小的效用损失实现了全面且稳定的机器遗忘,为大型推理模型中保护隐私的推理设定了新标准。
引用
@article{arxiv.2601.09281,
title = {STaR: Sensitive Trajectory Regulation for Unlearning in Large Reasoning Models},
author = {Jingjing Zhou and Gaoxiang Cong and Li Su and Liang Li},
journal= {arXiv preprint arXiv:2601.09281},
year = {2026}
}