中文

状态流变换器 (SST) V2:用于潜在空间推理的非线性递迹的并行训练

机器学习 2026-05-04 v1 计算与语言

摘要

当前的变换器丢弃其在位置之间的丰富潜在残差流,通过在每个新位置重建潜在推理上下文,留下潜在的推理容量未被利用。状态流变换器 (SST) V2 通过每个解码器层的 FFN 驱动的非线性递迹,实现了连续潜在空间中的参数高效推理,其中潜在状态通过学习的混合在完整序列上水平流动。该相同机制支持推理时间下对每个位置的连续潜在 deliberation,专注于在提交令牌之前探索抽象推理。两遍并行训练程序解决了递迹的序列依赖性,以实现计算效率训练。隐藏状态分析显示,状态流通过探索连续潜在空间中不同语义盆地的方式促进推理,其中以内容相关位置为转换点可将模型置于显著不同的贝叶斯后验中,直接影响未来位置的潜在空间。我们还发现,通过一个学习探针,在第一个生成的 token 位置,潜在状态已经预测了对于每个后续位置,最终答案是在进行额外的潜在计算后是存活还是崩溃。仅通过一个小数据集的 GSM8K 示例即被 co-train 到一个现有的 27B 主干网络中,SST 在野外 GPQA-Diamond 上比 fine-tuning 匹配的基线提升了 +15.15 分,并将该基线剩余的 GSM8K 错误减少 46%,这表明推理改进归因于该架构机制而非规模或训练数据。在 GPQA-Diamond 上,得到的 27B SST 还高于几个更大的开源和专有系统,包括最多 25 倍大小的开源模型。

关键词

引用

@article{arxiv.2605.00206,
  title  = {State Stream Transformer (SST) V2: Parallel Training of Nonlinear Recurrence for Latent Space Reasoning},
  author = {Thea Aviss},
  journal= {arXiv preprint arXiv:2605.00206},
  year   = {2026}
}

备注

48 pages, 21 figures