中文

重新编程视觉基础模型以实现时空预测

计算机视觉与模式识别 2025-07-17 v1 人工智能

摘要

基础模型在自然语言处理和计算机视觉领域取得了显著的成功,显示出对复杂模式建模的强大能力。虽然近期努力探索了将大型语言模型(LLM)用于时间序列预测,但LLM主要捕获一维序列依赖关系,难以建模实现准确时空(ST)预测所必需的更丰富的时空相关性。本文提出了一种新型框架ST-VFM,系统性地重新编程视觉基础模型(VFM)以实现通用时空预测。虽然VFM提供了强大的空间先验,但将其应用于ST任务时会出现两个关键挑战:(1)缺乏内在的时序建模能力;(2)视觉数据与时空数据之间的模态鸿沟。为解决这些挑战,ST-VFM采用包含原始时空输入和辅助时空流输入的双分支架构,其中流编码轻量级的时间差信号,可解释为动态空间线索。为有效处理这两个分支输入,ST-VFM引入两个专门的重新编程阶段。预VFM重新编程阶段应用时序感知Token适配器以嵌入时序上下文并将两个分支对齐到VFM兼容的特征空间。后VFM重新编程阶段引入双向跨提示协调模块,通过基于提示的条件化实现分支间的动态交互,从而在不修改冻结VFM主干网络的情况下丰富联合表征学习。广泛的实验在十个时空数据集上表明,ST-VFM超过了最先进的基线方法,展示了在不同VFM主干(例如DINO、CLIP、DEIT)和消融实验中的有效性和鲁棒性,证明其作为时空预测的强大通用框架。

引用

@article{arxiv.2507.11558,
  title  = {Reprogramming Vision Foundation Models for Spatio-Temporal Forecasting},
  author = {Changlu Chen and Yanbin Liu and Chaoxi Niu and Ling Chen and Tianqing Zhu},
  journal= {arXiv preprint arXiv:2507.11558},
  year   = {2025}
}