中文

基于潜在思维的推理:循环 Transformer 的能力

计算与语言 2025-02-25 v1 人工智能 机器学习

摘要

大型语言模型展现出了卓越的推理能力,且缩放定律表明庞大的参数量(尤其是沿深度轴的参数量)是其主要驱动力。在这项工作中,我们提出了一个更强的主张——许多推理问题需要很大的深度,但不一定需要很多参数。这解锁了循环模型在推理中的一种新颖应用。首先,我们表明对于许多合成推理问题(如加法、pp-跳归纳和数学问题),循环 LL 次的 kk 层 transformer 几乎匹配 kLkL 层非循环模型的性能,并且显著优于 kk 层模型。理论结果进一步证实了这一点,表明许多此类推理问题可以通过迭代算法解决,因此可以使用具有近乎最优深度的循环模型有效解决。也许令人惊讶的是,这些好处也转化到了语言建模的实际设置中——在许多下游推理任务中,循环 LL 次的 kk 层语言模型可以与 kLkL 层语言模型相媲美,甚至表现更好。事实上,我们的实证分析揭示了一个有趣的现象:循环和非循环模型表现出取决于其有效深度的缩放行为,类似于思维链推理的推理时缩放。我们通过证明循环模型隐式生成潜在思维并可以用 TT 次循环模拟 TT 步 CoT,进一步阐明了与 CoT 推理的联系。受这些发现的启发,我们还提出了推理与记忆之间有趣的二分法,并设计了一种在两方面都有效的基于循环的正则化。

关键词

引用

@article{arxiv.2502.17416,
  title  = {Reasoning with Latent Thoughts: On the Power of Looped Transformers},
  author = {Nikunj Saunshi and Nishanth Dikkala and Zhiyuan Li and Sanjiv Kumar and Sashank J. Reddi},
  journal= {arXiv preprint arXiv:2502.17416},
  year   = {2025}
}

备注

ICLR 2025