中文

UniVid:利用预训练视频生成模型统一视觉任务

计算机视觉与模式识别 2025-09-29 v1

摘要

在庞大语料库上训练的大型语言模型成功地在单一生成框架内统一了多样的语言任务。受此启发,最近的工作如大型视觉模型(LVM)通过将任务组织成顺序的视觉句子,将这一范式扩展到视觉领域,其中视觉提示作为引导输出的上下文。然而,这种建模需要跨模态和跨源的特定任务预训练,成本高昂且限制了对未见任务的可扩展性。鉴于预训练视频生成模型本质上捕获了时间序列依赖关系,我们探索了一种更统一且更具可扩展性的替代方案:预训练视频生成模型能否适应多样的图像和视频任务?为了回答这个问题,我们提出了 UniVid,这是一个微调视频扩散 Transformer 以处理各种视觉任务而无需特定任务修改的框架。任务被表示为视觉句子,其中上下文序列定义了任务和预期的输出模态。我们从两个角度评估了 UniVid 的泛化能力:(1) 由图像和视频组成的上下文的跨模态推理,超越了 LVM 的单模态设置;(2) 从自然数据到标注数据的跨源任务,无需多源预训练。尽管仅在自然视频数据上训练,UniVid 在这两种设置下均表现出良好的泛化能力。值得注意的是,在此范式中,理解与生成任务可以通过简单地反转视觉句子顺序来轻松切换。这些发现凸显了预训练视频生成模型作为视觉建模的可扩展且统一的基础的潜力。我们的代码将在 https://github.com/CUC-MIPG/UniVid 发布。

关键词

引用

@article{arxiv.2509.21760,
  title  = {UniVid: Unifying Vision Tasks with Pre-trained Video Generation Models},
  author = {Lan Chen and Yuchao Gu and Qi Mao},
  journal= {arXiv preprint arXiv:2509.21760},
  year   = {2025}
}