中文

混合与非混合大语言模型中的推理原语:架构差异在状态跟踪和记忆方面是否带来优势?

计算与语言 2026-05-27 v2 人工智能

摘要

大语言模型中的推理常被讨论为单一能力,但其部分收益可能源于更简单底层操作。我们通过五个受控任务族检验两种此类原语:记忆和状态跟踪,比较匹配的变换器和混合架构,带有和不带推理增强。整个套件中,推理增强型变体在指令-only 变体上通常以大幅度优势显著优于后者。这一模式在 State over Tokens 观点中保持一致:外部化推理痕迹之所以有用,是因为它们在 token 空间中携带中间状态。相比之下,混合归纳偏差在推理 token 可用后并不一致地在准确度上提供优势。当架构差异确实出现时,它们遵循任务结构:混合 Think 模型在严格的顺序链式更新上更稳健,而变换器 Think 模型在平坦的多跳检索上更稳健。因此,我们将本研究的主要贡献视为对基于状态记忆任务中性能驱动因素的描述性分析:推理-token 增强似乎是主要因素,而混合优势则更窄、取决于任务,可能更多是关于推理效率而非整体能力。我们还发布了复现这些结果所需的代码和数据。

关键词

引用

@article{arxiv.2604.21454,
  title  = {Reasoning Primitives in Hybrid and Non-Hybrid LLMs: Do Architectural Differences Yield Advantages in State-Tracking and Recall?},
  author = {Shivam Rawat and Lucie Flek and Florian Mai and Nicholas Kluge Corrêa},
  journal= {arXiv preprint arXiv:2604.21454},
  year   = {2026}
}