中文

将线性变换器解释为 VAR 模型:对齐自回归注意力机制与自回归预测

机器学习 2026-02-06 v2 人工智能 机器学习

摘要

基于自回归注意力机制的时间序列预测(TSF)日益受到关注,线性注意力有时能超越普通注意力。然而,更深层的变换器结构常与自回归目标不匹配,掩盖了线性注意力中嵌入的 VAR 结构,阻碍其捕捉 TSF 中数据生成过程。本文首先表明单个线性注意力层可解释为动态向量自回归(VAR)结构。随后说明,现有多层变换器与自回归预测目标存在结构性不匹配,损害可解释性和泛化能力。为此,我们展示通过重新排列 MLP、注意力和输入输出流程,多层线性注意力亦可对齐为 VAR 模型。随后,我们提出结构对齐的 VAR 混合模型(SAMoVAR),一种集成可解释动态 VAR 权重的线性变换器变体,用于多变量 TSF。通过将变换器架构与自回归目标对齐,SAMoVAR 在性能、可解释性和计算效率上均优于当前 SOTA TSF 模型。

关键词

引用

@article{arxiv.2502.07244,
  title  = {Linear Transformers as VAR Models: Aligning Autoregressive Attention Mechanisms with Autoregressive Forecasting},
  author = {Jiecheng Lu and Shihao Yang},
  journal= {arXiv preprint arXiv:2502.07244},
  year   = {2026}
}

备注

Camera-ready version. Accepted at ICML 2025