中文

R-TOFU:大型推理模型中的不可知技术

计算与语言 2025-05-28 v2

摘要

大型推理模型(LRMs)在其最终答案之外,还嵌入了私有或受版权保护的信息于多步骤链式思维(CoT)痕迹中,使得可靠的不可知远比标准大型语言模型(LLM)更具挑战性。我们引入推理-TOFU(R-TOFU),首个针对此场景的 benchmark。R-TOFU 将现有不可知任务增添现实的 CoT 注释,提供暴露答案级别检查难以察觉的残余知识的逐步指标。使用 R-TOFU,我们对比评估了基于梯度的和基于偏好优化的 baseline,发现仅针对答案的常规目标在推理中留下显著忘记痕迹。我们进一步提出 Reasoned IDK,一种偏好优化变体,实现保持连贯但不确定推理,较早期的拒绝式方法在忘却效能与模型实用性之间取得更佳平衡。最后,我们识别出一种失效模式:ZeroThink 和 LessThink 等解码变体即使在看似成功的不可知后,仍可能透露被忘记的内容,凸显需在多样化解码设置下评估模型的必要性。总体而言,本 benchmark、分析与新型 baseline 构成系统化研究与改进 LRMs 不可知性、同时保留其推理能力的基础。

关键词

引用

@article{arxiv.2505.15214,
  title  = {R-TOFU: Unlearning in Large Reasoning Models},
  author = {Sangyeon Yoon and Wonje Jeung and Albert No},
  journal= {arXiv preprint arXiv:2505.15214},
  year   = {2025}
}

备注

19 pages