中文

从缓冲机制视角理解语言模型以解决符号化多步推理问题

人工智能 2025-09-10 v3 计算与语言 机器学习

摘要

大型语言模型在复杂推理任务(如数学问题解决)方面始终表现不佳。研究这些模型的内部推理机制有助于设计更好的模型架构和训练策略,从而提升其推理能力。本研究构建了一个符号化多步推理任务,以探讨 Transformer 模型在通过直接回答和链式思维 (Chain-of-Thought, CoT) 推理时的信息传播机制。我们引入了缓冲机制的概念:模型在不同缓冲区存储各种信息,并通过查询-键矩阵有选择地提取这些信息。我们提出了一种基于随机矩阵的算法来增强模型的推理能力。该算法仅引入 132 个可训练参数,却在包含 PrOntoQA、LogicAsker 和 LogicInference 在内的 7 个多步推理数据集上显著提升了性能。这些发现为理解大型语言模型提供了新的视角。

关键词

引用

@article{arxiv.2405.15302,
  title  = {Understanding the Language Model to Solve the Symbolic Multi-Step Reasoning Problem from the Perspective of Buffer Mechanism},
  author = {Zhiwei Wang and Yunji Wang and Zhongwang Zhang and Zhangchen Zhou and Hui Jin and Tianyang Hu and Jiacheng Sun and Zhenguo Li and Yaoyu Zhang and Zhi-Qin John Xu},
  journal= {arXiv preprint arXiv:2405.15302},
  year   = {2025}
}