中文

视频原语学习:自回归变换器是零样本视频模仿者

计算机视觉与模式识别 2025-03-20 v2

摘要

人类主要依赖视觉信号与真实世界交互,这些信号普遍存在且提供详细演示。在本文中,我们探索了将视觉信号作为模型与环境交互的新接口。具体而言,我们选用视频作为代表性视觉信号。通过在视频数据集上以自监督目标训练自回归变换器,我们发现模型会产生一种零样本能力,从演示视频中推断语义,并将其模仿到未见情景中。这使模型能够通过以原语方式观看演示视频来完成未见任务,无需进一步微调。为验证模仿能力,我们设计了各种评估指标,包括客观和主观措施。结果表明,我们的模型能够生成高质量的视频片段,准确地与演示视频提供的语义指导相吻合,我们还展示了模仿能力遵循规模定律。代码和模型已开源。

关键词

引用

@article{arxiv.2407.07356,
  title  = {Video In-context Learning: Autoregressive Transformers are Zero-Shot Video Imitators},
  author = {Wentao Zhang and Junliang Guo and Tianyu He and Li Zhao and Linli Xu and Jiang Bian},
  journal= {arXiv preprint arXiv:2407.07356},
  year   = {2025}
}

备注

ICLR 2025