JEPA-Reasoner:从潜在空间推理中解耦 token 生成
计算与语言
2026-01-29 v3
摘要
当前自回归语言模型将高层推理与低层 token 生成耦合于单个序列过程中,使得推理轨迹易受到累积表达误差的影响。我们提出 JEPA-Reasoner,一种新型架构范式,通过 Joint-Embedding Predictive Architecture (JEPA) 实现纯潜在空间推理,同时独立的 Talker 模块负责语言重构。通过将推理引擎从离散 token 采样过程中解耦,Our architecture 实现:(1) 错误封闭,token 级别的错误无法传播至潜在推理链;(2) 持续引导,生成器可访问完整无损的推理轨迹;(3) 不确定性表示,模型可通过混合潜在向量维持多个假设。在合成数据和自然语言任务上的控制实验表明,此解耦方式使 0.9B 参数模型在相同数据上训练的耦合 Transformer baseline 基线 8-shot GSM8K 准确率提升 149.5%。本工作将注意力从扩大耦合模型转向探索解耦架构作为复杂推理更稳健的基础。
引用
@article{arxiv.2512.19171,
title = {JEPA-Reasoner: Decoupling Latent Reasoning from Token Generation},
author = {Bingyang Kelvin Liu and Ziyu Patrick Chen and David P. Woodruff},
journal= {arXiv preprint arXiv:2512.19171},
year = {2026}
}