理解时间序列 Transformer:秩结构、秩流与可压缩性
机器学习
2025-10-07 v1 人工智能
摘要
Transformer 广泛应用于各种数据模态,然而从文本模型中提炼出的原理往往不能完美地迁移到针对其他模态训练的模型上。在本文中,我们通过秩结构的视角分析 Transformer。我们关注时间序列场景,其数据的结构特性与文本或视觉截然不同。我们表明,与文本或视觉不同,时间序列嵌入表现出急剧衰减的奇异值谱:小的分块尺寸和平滑的连续映射将数据集中到低秩子空间中。由此,我们证明相关的 投影允许精确的低秩近似,并且注意力层的可压缩性与嵌入谱的衰减成正比。我们引入了秩流的概念,这是一种跨深度的非线性混合使秩膨胀的现象,解释了为什么早期层最易于压缩以及为什么秩随深度增长。在这些理论和实证结果的指导下,我们利用这些见解压缩 Chronos(一个大型时间序列基础模型),在不损失精度的前提下,实现了 的推理时间和 的内存减少。我们的发现为在时间序列基础模型中分配宽度、深度和头数,以及利用其固有的可压缩性提供了原则性的指导。
引用
@article{arxiv.2510.03358,
title = {Understanding Transformers for Time Series: Rank Structure, Flow-of-ranks, and Compressibility},
author = {Annan Yu and Danielle C. Maddix and Boran Han and Xiyuan Zhang and Abdul Fatir Ansari and Oleksandr Shchur and Christos Faloutsos and Andrew Gordon Wilson and Michael W. Mahoney and Yuyang Wang},
journal= {arXiv preprint arXiv:2510.03358},
year = {2025}
}
备注
42 pages