SAMformer:利用锐度感知最小化和通道注意力解锁 Transformer 在时间序列预测中的潜力
机器学习
2024-06-04 v3 机器学习
摘要
基于 Transformer 的架构在自然语言处理和计算机视觉领域取得了突破性性能,但在多变量长期预测中仍逊于更简单的线性基线。为了更好地理解这一现象,我们首先研究了一个玩具线性预测问题,并表明尽管 Transformer 具有高表达能力,却无法收敛到其真实解。我们进一步确定 Transformer 的注意力机制是导致这种低泛化能力的原因。基于这一见解,我们提出了一种浅层轻量级 Transformer 模型,当使用锐度感知优化进行优化时,该模型能成功逃离不良局部极小值。我们在经验上证明,这一结果适用于所有常用的现实世界多变量时间序列数据集。特别是,SAMformer 超越了当前的最先进 (SOTA) 方法,并与最大的基础模型 MOIRAI 相当,同时参数量显著减少。代码地址:https://github.com/romilbert/samformer。
引用
@article{arxiv.2402.10198,
title = {SAMformer: Unlocking the Potential of Transformers in Time Series Forecasting with Sharpness-Aware Minimization and Channel-Wise Attention},
author = {Romain Ilbert and Ambroise Odonnat and Vasilii Feofanov and Aladin Virmaux and Giuseppe Paolo and Themis Palpanas and Ievgen Redko},
journal= {arXiv preprint arXiv:2402.10198},
year = {2024}
}
备注
Accepted as an Oral at ICML 2024, Vienna. The first two authors contributed equally