注意力诅咒:基于核方法的时序预测中 Transformer 为何难以泛化
机器学习
2025-03-04 v2 人工智能
摘要
Transformer 模型在时序预测(TSF)任务中备受推崇,但许多研究未能超越简单线性残差模型,理论层面的理解仍有限。本文提出了对 Transformer 在 TSF 任务中效率低下的首个理论解释。我们将其机制归因于训练注意力网络中的“非对称学习”。当时间序列中下一步预测的符号与前一步的符号不一致时,注意力机制难以学习残差特征。这使得在分布外(OOD)数据上尤其是在符号不一致的下一步预测数据上(具有相同表示模式)难以泛化,而线性残差网络则能轻松实现。我们希望这些理论见解为实践者设计具表达力和效率的基于 Transformer 的架构提供重要必要条件。
关键词
引用
@article{arxiv.2412.06061,
title = {Curse of Attention: A Kernel-Based Perspective for Why Transformers Fail to Generalize on Time Series Forecasting and Beyond},
author = {Yekun Ke and Yingyu Liang and Zhenmei Shi and Zhao Song and Chiwun Yang},
journal= {arXiv preprint arXiv:2412.06061},
year = {2025}
}
备注
CPAL 2025