无需注意力的推理扩展
机器学习
2025-05-29 v1 人工智能
计算与语言
摘要
大型语言模型(LLM)在复杂推理任务中取得了重大进展,但仍受两个核心挑战的瓶颈制约:由于依赖Transformer而导致的架构低效,以及缺乏针对高难度领域的结构化微调。我们引入了 \ourmodel,这是一种无注意力语言模型,通过架构和数据中心的创新解决了这两个问题。基于Mamba-2的状态空间对偶(SSD)层构建,我们的模型消除了对自注意力和键值缓存的需求,实现了固定内存、常数时间的推理。为了训练其进行复杂推理,我们提出了一种基于 \textsc{PromptCoT} 合成范式的两阶段课程微调策略,该范式通过抽象概念选择和理由引导的生成来生成具有教学结构的题目。在基准评估中,\ourmodel-7B 优于同等规模的强大Transformer和混合模型,甚至在AIME 24上超越了大得多的 Gemma3-27B 2.6\%,在AIME 25上超越0.6\%,在Livecodebench上超越3.0\%。这些结果凸显了状态空间模型作为基于注意力架构的高效且可扩展替代方案在高容量推理中的潜力。
引用
@article{arxiv.2505.22425,
title = {Scaling Reasoning without Attention},
author = {Xueliang Zhao and Wei Wu and Lingpeng Kong},
journal= {arXiv preprint arXiv:2505.22425},
year = {2025}
}
备注
preprint