中文

通过遗忘推理步骤衡量链式思维忠诚度

计算与语言 2025-12-16 v4

摘要

当被要求逐步思考时,语言模型 (LM) 会产生一系列思维链 (CoT),即一系列推理步骤,模型据此据称用于生成其预测。尽管已有大量工作聚焦于 CoT 提示,但推理在 CoT 中的 verbalized 方式是否忠实于模型的 parameters 信念仍不清晰。我们引入了衡量生成推理参数忠诚度的框架,并提出 Faithfulness by Unlearning Reasoning steps (FUR) 作为该框架的一个实例。FUR 从模型参数中擦除包含在推理步骤中的信息,并将忠诚度衡量为对模型预测产生的结果。我们针对四个 LM 和五个多跳多选问答 (MCQA) 数据集进行了实验,结果表明 FUR 能够精确地通过遗忘关键步骤来改变给定实例的模型预测,这表明了 CoT 在参数层面上的忠诚度。进一步的分析显示,遗忘后生成的 CoT 支持不同的答案,暗示了遗忘的更深层次效果。

关键词

引用

@article{arxiv.2502.14829,
  title  = {Measuring Chain of Thought Faithfulness by Unlearning Reasoning Steps},
  author = {Martin Tutek and Fateme Hashemi Chaleshtori and Ana Marasović and Yonatan Belinkov},
  journal= {arXiv preprint arXiv:2502.14829},
  year   = {2025}
}

备注

Outstanding paper at EMNLP 2025