中文

时空语义对齐:将视觉模型中的空间先验统一迁移到零样本时序任务的框架

计算机视觉与模式识别 2025-11-26 v1

摘要

大型多模态模型 (LMM) 在跨文本素和图像模态的对齐与生成方面取得了显著进展。然而,将非视觉、连续序列作为高保真图像生成的条件信号的潜力尚未得到充分探索。此外,现有方法将序列转换为“伪图像”进行时序预测,无法在语义层面建立对齐。本文提出 TimeArtist,一种时空转换框架,首次在时间序列波动和视觉概念之间建立语义层面的对齐。它 pioneering a “warmup-align” 范式:首先,在大规模数据集上对双自动编码器和共享量化器进行自监督训练,以学习共享的表征。随后,冻结编码器和量化器,引入投影以在表征层面对齐时序和视觉样本。TimeArtist 建立了一个灵活的跨模态框架,使其能够直接从时间序列生成高质量、多样化的图像,同时捕捉时序波动模式以渲染图像风格迁移。广泛的实验表明,TimeArtist 在图像生成指标上表现良好,同时在零样本时序任务中取得优异结果。我们的工作建立了一种新的跨模态生成范式,弥合了时序动力学与视觉语义之间的鸿沟。

关键词

引用

@article{arxiv.2511.19856,
  title  = {Temporal-Visual Semantic Alignment: A Unified Architecture for Transferring Spatial Priors from Vision Models to Zero-Shot Temporal Tasks},
  author = {Xiangkai Ma and Han Zhang and Wenzhong Li and Sanglu Lu},
  journal= {arXiv preprint arXiv:2511.19856},
  year   = {2025}
}