Poolformer:用于长序列建模的带池化的循环网络
机器学习
2025-10-03 v1
摘要
序列到序列模型已成为人工智能的核心,特别是在引入 Transformer 架构之后。虽然最初是为自然语言处理开发的,但这些模型已证明在包括计算机视觉在内的多个领域中的效用。此类模型需要沿时间维度交换信息的机制,通常使用循环或自注意力层。然而,自注意力随序列长度二次增长,限制了其在极长序列中的实用性。我们提出了 Poolformer,一种用循环层替代自注意力并引入池化操作以减少序列长度的序列到序列模型。Poolformer 通过 SkipBlocks 递归定义,SkipBlocks 包含残差块、下采样层、嵌套的 SkipBlock、上采样层和额外的残差块。我们进行了大量实验来支持我们的架构选择。结果表明,池化显著加速了训练,改善了感知指标(FID 和 IS),并防止了过拟合。我们的实验还表明,长程依赖由深层处理,而浅层负责短期特征。在天然具有长序列长度的原始音频上评估时,Poolformer 优于 SaShiMi 和 Mamba 等最先进模型。未来方向包括文本和视觉以及多模态场景中的应用,在这些场景中,基于 Poolformer 的大语言模型可以有效处理图像和视频的密集表示。
引用
@article{arxiv.2510.02206,
title = {Poolformer: Recurrent Networks with Pooling for Long-Sequence Modeling},
author = {Daniel Gallo Fernández},
journal= {arXiv preprint arXiv:2510.02206},
year = {2025}
}