中文

揭示时间序列模型中少数层的支配效应

机器学习 2025-11-11 v1 计算与语言

摘要

大规模模型正处于时间序列(TS)预测的前沿,主要由两种范式主导:微调基于文本的大型语言模型(LLM4TS)和从头训练时间序列基础模型(TSFMs)。这两种方法都共享一个基础假设,即模型容量和数据volume的扩大会导致性能提升。然而,我们观察到TS模型存在一种\textit{尺度悖论},揭示了更大模型并不实现更好性能的令人困惑的现象。通过在两个模型家族中进行大规模实验(从100M到1.7B参数),以及处理多样化数据(最高达60亿观察),我们严格确认了尺度悖论是一个普遍存在的问题。随后,我们通过分析内部表示来诊断其根本原因,识别出一种我们称为\textit{少数层支配}的现象:只有一小部分层在功能上至关重要,而大多数层是冗余的、未被充分利用的,甚至可能干扰训练。基于这一发现,我们提出了一种实用方法来自动识别并保留这些支配层。在我们的模型中,仅保留21%的参数即可实现最高12%的准确率提高和2.7倍的推理加速。我们在8个著名SOTA模型(LLM4TS和TSFMs,参数规模从90M到6B)上验证了该方法的普适性,表明保留少于30%的层数即可在超过95%的任务中实现相当或更好的准确率。

关键词

引用

@article{arxiv.2511.07237,
  title  = {The Few Govern the Many:Unveiling Few-Layer Dominance for Time Series Models},
  author = {Xin Qiu and Junlong Tong and Yirong Sun and Yunpu Ma and Xiaoyu Shen},
  journal= {arXiv preprint arXiv:2511.07237},
  year   = {2025}
}