如何逐步思考:思维链推理的机制理解
计算与语言
2024-05-07 v2 机器学习
摘要
尽管大型语言模型(LLMs)在思维链(CoT)提示下展现出卓越的推理能力,但对模型内部促进CoT生成的机制仍缺乏理解。本文从机制角度研究了LLMs中体现CoT推理的神经子结构。通过对Llama-2 7B在虚构本体上的多步推理进行分析,我们证明LLMs为逐步推理部署了多条并行的答案生成路径。这些并行路径从输入问题上下文以及生成的CoT中提供顺序答案。我们观察到LLM中间层存在功能裂谷。前半部分的令牌表示强烈偏向于预训练先验,而后半部分则由上下文先验主导。这种内部相位转移体现在不同的功能组件中:写入答案令牌的注意力头出现在后半部分,沿本体关系移动信息的注意力头出现在前半部分,等等。据我们所知,这是首次对LLMs中CoT推理进行机制性研究的尝试。
引用
@article{arxiv.2402.18312,
title = {How to think step-by-step: A mechanistic understanding of chain-of-thought reasoning},
author = {Subhabrata Dutta and Joykirat Singh and Soumen Chakrabarti and Tanmoy Chakraborty},
journal= {arXiv preprint arXiv:2402.18312},
year = {2024}
}