InternVideo-Next: 迈向无视频-文本监督的通用视频基础模型
计算机视觉与模式识别
2026-03-31 v2
摘要
大规模视频-文本预训练取得了强劲性能,但依赖于噪声大、语义覆盖有限的合成字幕,常常忽略隐式世界知识,如物体运动、三维几何和物理线索。相比之下,掩码视频建模(MVM)直接利用时空结构,但在通用任务上落后于文本监督方法。我们发现这一差距源于被忽视的架构问题:像素级重建在收敛性上存在困难,其低层要求经常与语义冲突,而隐式预测往往鼓励捷径学习。为解决这些问题,我们将传统的编码器-解码器设计解耦为编码器-预测器-解码器(EPD)框架,其中预测器充当隐式世界模型,并提出了InternVideo-Next,一种两阶段预训练方案,为该世界模型构建语义一致且细节保留的隐式空间。首先,像素MVM中的传统线性解码器强制预测器输出隐式被线性投影,因此在像素空间中可分离,导致与语义抽象的冲突。我们的第一阶段提出条件扩散解码器并注入可靠的图像级语义先验以增强语义和收敛性,从而弥合像素级保真度与高层语义抽象之间的差距。第二阶段进一步通过在隐式空间中预测冻结的第一阶段目标来学习世界知识,缓解捷径学习。在公共无标签视频上训练,InternVideo-Next在基准测试上取得了最先进的结果,并为通用视频表示学习提供了可扩展的路径。
引用
@article{arxiv.2512.01342,
title = {InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision},
author = {Chenting Wang and Yuhan Zhu and Yicheng Xu and Jiange Yang and Lang Lin and Ziang Yan and Yali Wang and Yi Wang and Limin Wang},
journal= {arXiv preprint arXiv:2512.01342},
year = {2026}
}