中文

稀疏自动编码器下的链式思考机制可解释性研究

计算与语言 2025-08-01 v1 人工智能

摘要

链式思考(Chain-of-Thought, CoT)提示法提升了大型语言模型在多步骤任务上的准确率,但生成的“思考”是否反映了模型内部真实的推理过程尚未解决。我们进行了 CoT 可信度的首次特征级因果研究。通过将稀疏自动编码器与激活补丁相结合,我们在 Pythia-70M 和 Pythia-2.8B 模型中提取了单语义特征,使其在 CoT 和 plain(无 CoT)提示下解决 GSM8K 数学问题。将少量 CoT 推理特征交换到 noCoT 运行中可显著提升 2.8B 模型的答案对数概率,但在 70M 模型中无可靠效果,揭示了明确的规模阈值。CoT 也导致更大模型中激活稀疏性和特征可解释性显著提高,信号明确更模块化的内部计算。例如,模型对生成正确答案的置信度提升从 1.2 增至 4.3。我们引入了 patch 曲线和随机特征补丁基线,表明有用的 CoT 信息不仅存在于 top-K 补丁中,还广泛分布。总体而言,我们的结果表明 CoT 可在高容量 LLM 中诱导更可解释的内部结构,证明其作为结构化提示方法的作用。

关键词

引用

@article{arxiv.2507.22928,
  title  = {How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding},
  author = {Xi Chen and Aske Plaat and Niki van Stein},
  journal= {arXiv preprint arXiv:2507.22928},
  year   = {2025}
}