中文

Seg-MoE:面向时间序列预测Transformer的分段-混合专家

机器学习 2026-03-17 v2 人工智能

摘要

基于Transformer的模型最近在准确的时间序列预测方面取得了显著进展,但即便是这些体系结构在捕捉长期时序动力学方面仍难以有效扩展。混合专家(MoE)层是自然语言处理中解决规模问题的成熟方案。然而,现有的MoE方法用于时间序列预测依赖于基于token的路由机制,这可能无法利用时序数据的天然局部性和连续性。在本工作中,我们引入Seg-MoE,即一种稀疏MoE设计,通过路由和处理连续的时间步分段来代替独立的专家决策。token分段允许每个专家直接建模分段内的相互作用,自然地与固有的时序模式相吻合。我们将Seg-MoE层集成到时间序列Transformer中,并在多个多变量长期预测基准上进行评估。Seg-MoE在几乎所有预测时段上始终实现了最先进的预测精度,超越了密集Transformer和以前的基于token的MoE模型。全面的消融研究确认,分段级别的路由是这些收益的关键因素。我们的结果表明,将MoE路由粒度与时序数据固有结构保持一致,提供了一种强大的、此前较少探索的归纳偏置,为顺序数据建模中的条件稀疏体系结构开辟了新的方向。

关键词

引用

@article{arxiv.2601.21641,
  title  = {Seg-MoE: Multi-Resolution Segment-wise Mixture-of-Experts for Time Series Forecasting Transformers},
  author = {Evandro S. Ortigossa and Eran Segal},
  journal= {arXiv preprint arXiv:2601.21641},
  year   = {2026}
}

备注

Under review