Thoughtbubbles:一种在潜空间中实现并行思考的无监督方法
机器学习
2026-02-02 v2 人工智能
计算与语言
神经与进化计算
摘要
当前扩展 Transformer 推理时计算的方法是训练它们在产生答案之前输出显式的思维链 token。虽然这些方法很强大,但它们存在局限性,因为它们无法在预训练期间应用,且完全依赖于序列生成的自然语言表达。在这项工作中,我们提出了 Thoughtbubbles,这是一种 Transformer 变体,它通过学习分叉或删除残差流,原生地在潜空间中执行并行自适应计算。因此,需要更多计算的 token 可以在网络中间形成一个克隆残差的“气泡”。关键是,这种行为是在预训练期间仅使用语言建模损失学习到的。使用一半的训练预算,Thoughtbubbles 在困惑度和零样本评估上均优于标准解码器语言模型以及使用非自适应并行计算方法的模型。这些结果在从 150M 到 1.9B 的模型大小中均成立。Thoughtbubbles 使用一半的基线 token 预算取得了具竞争力的 GSM8K 结果。我们方法的隐式特性使模型能够在预训练时开始学习自适应计算,为统一的训练时和测试时缩放行为铺平道路。
引用
@article{arxiv.2510.00219,
title = {Thoughtbubbles: an Unsupervised Method for Parallel Thinking in Latent Space},
author = {Houjun Liu and Shikhar Murty and Christopher D. Manning and Róbert Csordás},
journal= {arXiv preprint arXiv:2510.00219},
year = {2026}
}