大语言模型中的链条推理:解码、投影与激活
人工智能
2024-12-06 v1
摘要
链条推理提示词显著提升了大型语言模型的推理能力,已有众多研究探讨其影响性能的因素。然而,其背后的机制仍鲜有了解。为进一步阐明其运作原理,本文考察了三个关键方面:解码、投影和激活,旨在阐明在采用链条推理时模型内部发生的变化。我们的发现表明,LLMs在模仿示例格式的同时,将其与对问题的理解相结合,在生成过程中表现出标记概率的波动,但最终产生更集中分布的概率,同时在最终层激活更广泛的神经元,这表明其在知识检索方面比标准提示词更为广泛。我们的代码和数据将在论文被接受后公开。
引用
@article{arxiv.2412.03944,
title = {Chain-of-Thought in Large Language Models: Decoding, Projection, and Activation},
author = {Hao Yang and Qianghua Zhao and Lei Li},
journal= {arXiv preprint arXiv:2412.03944},
year = {2024}
}