中文

SCOUT:教导预训练语言模型通过流式思维链增强推理

人工智能 2025-06-02 v1

摘要

思维链(CoT)提示通过鼓励逐步思考来提升大型语言模型(LLM)的推理性能。然而,基于CoT的方法依赖于中间推理步骤,这限制了可扩展性和泛化能力。近期的工作探索了递归推理,其中LLM在迭代中重用内部层以优化潜在表示,而无需显式的CoT监督。虽然前景广阔,但这些方法通常需要昂贵的预训练,并且缺乏关于推理应如何在迭代间演化的原则性框架。我们通过引入流式思维链(Flow CoT)来解决这一空白,这是一种将递归推理建模为潜在认知状态渐进轨迹的推理范式。Flow CoT将每次迭代构建为一个独特的认知阶段,在不依赖人工监督的情况下深化跨迭代的推理。为了实现这一点,我们提出了SCOUT(Stepwise Cognitive Optimization Using Teachers),一个轻量级微调框架,能够在无需预训练的情况下实现Flow CoT风格的推理。SCOUT使用渐进式蒸馏将每次迭代与具有适当容量的教师模型对齐,并使用基于交叉注意力的回顾模块整合先前迭代的输出,同时保持模型原有的计算流。在八个推理基准上的实验表明,SCOUT持续提升了准确性和解释质量,在微调下实现了高达1.8%的增益。定性分析进一步表明,SCOUT能够在迭代中实现逐步深化的推理,优化了信念形成和解释粒度。这些结果不仅验证了SCOUT的有效性,还证明了Flow CoT作为增强LLM推理能力的可扩展框架的实用可行性。

关键词

引用

@article{arxiv.2505.24181,
  title  = {SCOUT: Teaching Pre-trained Language Models to Enhance Reasoning via Flow Chain-of-Thought},
  author = {Guanghao Li and Wenhao Jiang and Mingfeng Chen and Yan Li and Hao Yu and Shuting Dong and Tao Ren and Ming Tang and Chun Yuan},
  journal= {arXiv preprint arXiv:2505.24181},
  year   = {2025}
}