中文

大语言模型中的链条推理:解码、投影与激活

人工智能 2024-12-06 v1

摘要

链条推理提示词显著提升了大型语言模型的推理能力,已有众多研究探讨其影响性能的因素。然而,其背后的机制仍鲜有了解。为进一步阐明其运作原理,本文考察了三个关键方面:解码、投影和激活,旨在阐明在采用链条推理时模型内部发生的变化。我们的发现表明,LLMs在模仿示例格式的同时,将其与对问题的理解相结合,在生成过程中表现出标记概率的波动,但最终产生更集中分布的概率,同时在最终层激活更广泛的神经元,这表明其在知识检索方面比标准提示词更为广泛。我们的代码和数据将在论文被接受后公开。

关键词

引用

@article{arxiv.2412.03944,
  title  = {Chain-of-Thought in Large Language Models: Decoding, Projection, and Activation},
  author = {Hao Yang and Qianghua Zhao and Lei Li},
  journal= {arXiv preprint arXiv:2412.03944},
  year   = {2024}
}