中文

万物皆视频:通过下一帧预测统一模态

计算机视觉与模式识别 2025-07-29 v2 计算与语言 机器学习

摘要

多模态学习涉及整合文本、图像、音频和视频等多种模态的信息,是视觉问答、跨模态检索和标题生成等众多复杂任务的关键。传统方法依赖模态专用编码器和后期融合技术,这在适应新任务或新模态时会阻碍可扩展性和灵活性。为解决这些局限,我们提出一个新框架,将任务重构的概念从自然语言处理(NLP)扩展到多模态学习。我们将多样的多模态任务重构为统一的下一帧预测问题,使单一模型无需模态专用组件即可处理不同模态。该方法将所有输入和输出视为视频中的序列帧,实现模态的无缝融合和跨任务的有效知识迁移。我们在文本到文本、图像到文本、视频到视频、视频到文本和音频到文本等一系列任务上评估该方法,展示了模型仅需极少适应即可跨模态泛化的能力。我们表明任务重构能显著简化各类任务的多模态模型设计,为更通用的多模态基础模型奠定基础。

关键词

引用

@article{arxiv.2411.10503,
  title  = {Everything is a Video: Unifying Modalities through Next-Frame Prediction},
  author = {G. Thomas Hudson and Dean Slack and Thomas Winterbottom and Jamie Sterling and Chenghao Xiao and Junjie Shentu and Noura Al Moubayed},
  journal= {arXiv preprint arXiv:2411.10503},
  year   = {2025}
}

备注

10 pages, 10 figures