SST:用于时间序列预测的多尺度混合 Mamba-Transformer 专家模型
机器学习
2025-11-04 v3 人工智能
摘要
时间序列预测已取得显著进展,包括基于Transformer的模型。Transformer中的注意力机制通过同时关注所有过去的输入,有效地捕获了时间依赖性。然而,其相对于序列长度的二次复杂度限制了对长程建模的可扩展性。诸如Mamba等最近的状态空间模型(SSMs)通过在不使用注意力的情况下实现线性复杂度,提供了一种有前景的替代方案。但是,Mamba将历史信息压缩到固定大小的潜在状态中,可能造成信息丢失并限制表示的有效性。这引出了一个关键的研究问题:我们能否设计一种既有效又高效适用于时间序列预测的混合Mamba-Transformer架构?为了解决这个问题,我们将最初为语言建模提出的混合Mamba-Transformer架构Mambaformer适配到时间序列领域。初步实验表明,在Mambaformer中简单堆叠Mamba和Transformer层对于时间序列预测是次优的,因为存在信息干扰问题。为了缓解这个问题,我们引入了一种新的时间序列分解策略,将时间序列分离为长程模式和短程变化。然后我们表明,Mamba擅长捕获长期结构,而Transformer在建模短期动态方面更有效。基于这一洞察,我们提出了状态空间Transformer(SST),这是一个带有专家模块的多尺度混合模型:用于长程模式的Mamba专家和用于短程变化的Transformer专家。SST还采用多尺度分块机制来自适应调整时间序列分辨率:低分辨率用于长期模式,高分辨率用于短期变化。实验表明,SST以线性可扩展性获得了SOTA性能。代码位于 https://github.com/XiongxiaoXu/SST。
引用
@article{arxiv.2404.14757,
title = {SST: Multi-Scale Hybrid Mamba-Transformer Experts for Time Series Forecasting},
author = {Xiongxiao Xu and Canyu Chen and Yueqing Liang and Baixiang Huang and Guangji Bai and Liang Zhao and Kai Shu},
journal= {arXiv preprint arXiv:2404.14757},
year = {2025}
}
备注
CIKM 2025