MICA:用于时间序列预测的多变量无穷压缩注意力
机器学习
2026-05-12 v2
摘要
使用Transformer进行多变量预测面临一个核心可扩展性挑战:通过注意力建模跨通道依赖关系将注意力的二次序列复杂度与二次通道缩放复合起来,使得全跨通道注意力对于高维时间序列不切实际。我们提出了多变量无穷压缩注意力(MICA),一种将通道独立Transformer扩展至通道依赖预测的架构设计。通过将高效注意力技术从序列维度适配到通道维度,MICA在通道独立骨干网络上添加了一个跨通道注意力机制,其规模随通道数和上下文长度线性增长。我们在多个预测基准上评估了带和不带MICA的通道独立Transformer架构。MICA平均将其通道独立对应模型的预测误差降低了5.4%,在个别数据集上最高降低25.4%,凸显了显式跨通道建模的重要性。此外,带有MICA的模型在深度多变量Transformer和MLP基线中排名第一。MICA模型在通道数和上下文长度方面也比同时在时间和通道维度上计算注意力的Transformer基线扩展得更高效,确立了压缩注意力作为可扩展多变量预测的实用解决方案。
引用
@article{arxiv.2604.06473,
title = {MICA: Multivariate Infini Compressive Attention for Time Series Forecasting},
author = {Willa Potosnak and Nina Żukowska and Michał Wiliński and Dan Howarth and Ignacy Stępka and Mononito Goswami and Artur Dubrawski},
journal= {arXiv preprint arXiv:2604.06473},
year = {2026}
}