从扩张到循环:LLM 中迭代计算的统一视角
计算与语言
2026-02-19 v1 人工智能
机器学习
摘要
循环(在深度中重复使用同一层块)和深度扩张(通过复制中间层实现浅层到深层模型训练)都被链接到更强的推理能力,但它们的关系尚不清晰。我们提供一种机制性的统一:循环模型和深度扩张模型表现出收敛的深度相关特征,包括对后期层的更大依赖以及与循环或扩张块对齐的重复模式。这些共享特征支持将其收益来源视为来自常见形式的迭代计算的观点。建立在这种联系之上,我们表明这两种技术是可适应且可组合的:对深度扩张模型中间块应用推理时间循环可使某些推理基本工具的准确率提高最高可达 ,尽管该模型从未被训练以循环。两种方法在给定更多情境示例或额外的监督微调数据时也都适应性更好。此外,深度扩张模型在使用更高质量、数学密集型 cooldown 混合方案时可实现最大的推理收益,而通过适配中间块以循环进一步可提升。总体而言,我们的结果将深度扩张和循环定位为用于诱导和扩展迭代计算以提高推理能力的互补、实用方法。
引用
@article{arxiv.2602.16490,
title = {From Growing to Looping: A Unified View of Iterative Computation in LLMs},
author = {Ferdinand Kapl and Emmanouil Angelis and Kaitlin Maile and Johannes von Oswald and Stefan Bauer},
journal= {arXiv preprint arXiv:2602.16490},
year = {2026}
}