中文

逐 token 检查链式思维推理中的记忆现象

计算与语言 2025-08-22 v2 人工智能

摘要

大型语言模型(LLM)在推理基准测试中表现良好,但在输入轻微改变时常常失败,这引发了其成功是否依赖于记忆的担忧。这种问题在链式思维(CoT)推理中尤为突出,因为不恰当的记忆模式会触发中间错误,进而导致最终答案错误。我们引入了 STIM(Source-aware Token-level Identification of Memorization,源感知记忆标记识别框架),该框架基于预训练语料库中 token 与其统计共现情况,将推理链中的每个 token归因于多个记忆来源之一——局部记忆、中距离记忆或远程记忆。我们的 token 级别分析跨越任务和分布设置揭示,模型在复杂或长尾情形中更依赖记忆,且局部记忆往往是驱动错误的主要因素,导致错误 token 比例可达 67%。我们还表明,STIM 提供的记忆得分能够有效预测推理步骤中错误 token。STIM 为诊断和改进模型推理提供了强大工具,可推广至其他结构化逐步生成任务。

关键词

引用

@article{arxiv.2508.02037,
  title  = {Diagnosing Memorization in Chain-of-Thought Reasoning, One Token at a Time},
  author = {Huihan Li and You Chen and Siyuan Wang and Yixin He and Ninareh Mehrabi and Rahul Gupta and Xiang Ren},
  journal= {arXiv preprint arXiv:2508.02037},
  year   = {2025}
}