SSDA:通过双适配桥接谱域与结构差距面向视觉的时序预测
计算机视觉与模式识别
2026-05-14 v1 人工智能
摘要
大型视觉模型 (LVM) 近期证明在将时序数据渲染为图像后,竟能成为意外且相当有效的时间序列预测器。然而,这一成功依赖于一个基本未被检视的前提:渲染后的时序图像与自然图像 sufficiently 接近,以便有效迁移预训练模型中的知识。我们指出,实际上仍存在两个差距,即谱域差距和结构差距,从根本上限制了 LVM 在时序预测中的潜力。从谱域看,我们系统性地揭示,渲染后的时序图像呈现出显著浅的功率谱,远低于自然图像上 LVM 所训练的对象。从结构上看,将 1 维时序序列重塑为 2D 网格会制造出虚构的空间相邻关系,同时切断真实的时序连续性,误导了预训练 LVM 的空间归纳偏置。为桥接这些差距,我们提出了 SSDA,即双分支网络,通过谱域和结构适配以释放 LVM 在时序预测中的最大潜力。在数据层面,谱域幅度对齐器 (SMA) 应用 2D FFT, selectively 增强幅度谱以接近自然图像统计特征,同时保持相位。在模型层面,结构引导的低秩适配 (SG-LoRA) 注入位置感知的时序编码至 patch 嵌入,并通过低秩更新进行注意力适配。两个分支进一步通过自适应融合机制产生最终预测。在七个真实世界基准上的大量实验表明,SSDA 在 full-shot 与 few-shot 设置下,均显著优于强大的 LVM 与 LLM 基线。代码已公开于 https://anonymous.4open.science/r/SSDA-8C5B。
引用
@article{arxiv.2605.12550,
title = {SSDA: Bridging Spectral and Structural Gaps via Dual Adaptation for Vision-Based Time Series Forecasting},
author = {Mingrui Zhang and Hanchen Yang and Wengen Li and Xudong Jiang and Yichao Zhang and Jihong Guan and Shuigeng Zhou},
journal= {arXiv preprint arXiv:2605.12550},
year = {2026}
}