理解并改进循环模型中的长度泛化
机器学习
2025-10-14 v2
摘要
近年来,状态空间模型和线性注意力等循环模型因其在序列长度上的线性复杂度而变得流行。得益于其循环特性,原则上它们可以处理任意长的序列,但它们的性能有时会在超出训练上下文长度时显著下降——即它们无法实现长度泛化。在这项工作中,我们提供了全面的实证和理论分析来支持“未探索状态假说”,该假说认为,当模型在训练期间仅暴露于所有可达状态(即如果将循环应用于长序列将达到的状态)分布的一个有限子集时,它们无法实现长度泛化。此外,我们研究了简单的训练干预措施,旨在增加模型训练所覆盖的状态范围,例如通过用高斯噪声或不同输入序列的最终状态来初始化状态。仅需500步后训练步骤(约为预训练预算的0.1%),这些干预措施就能使模型对比训练上下文长数个数量级的序列(例如,从2k到128k)实现长度泛化,并在长上下文任务中展现出改进的性能,从而为在通用循环模型中实现鲁棒的长度泛化提供了一种简单而高效的方法。
引用
@article{arxiv.2507.02782,
title = {Understanding and Improving Length Generalization in Recurrent Models},
author = {Ricardo Buitrago Ruiz and Albert Gu},
journal= {arXiv preprint arXiv:2507.02782},
year = {2025}
}