UniSTD:面向多学科的统一时空学习框架
计算机视觉与模式识别
2025-03-27 v1
摘要
传统时空模型通常依赖于特定任务的架构,由于领域特定的设计要求,限制了其在不同任务之间的可通用性和可扩展性。本文引入了 \textbf{UniSTD},一个基于 Transformer 的统一时空建模框架,灵感来自最近基础模型中两种阶段的预训练-适应范式。具体而言,我们展示了在 2D 视觉和视觉-文本数据集上进行任务无关的预训练,可以构建一个通用且可迁移的时空学习模型基础,随后在时空数据集上进行特定任务的联合训练以增强任务适应性。为提升跨域学习能力,我们框架采用基于分数插值的秩自适应混合专家适应方法,通过放松离散变量实现在连续空间中的优化。此外,我们引入时序模块以显式融合时序动态。我们在覆盖 10 项任务、跨越 4 个学科的大规模数据集上进行评估,证明统一时空模型能够实现可扩展的跨任务学习,并支持在单个模型中同时处理最多 10 项任务,同时降低多域应用中的训练成本。代码将在 https://github.com/1hunters/UniSTD 提供。
关键词
引用
@article{arxiv.2503.20748,
title = {UniSTD: Towards Unified Spatio-Temporal Learning across Diverse Disciplines},
author = {Chen Tang and Xinzhu Ma and Encheng Su and Xiufeng Song and Xiaohong Liu and Wei-Hong Li and Lei Bai and Wanli Ouyang and Xiangyu Yue},
journal= {arXiv preprint arXiv:2503.20748},
year = {2025}
}
备注
Accepted to CVPR 2025