FRAME:通过预见与记忆实现视频特征表示的预训练
计算机视觉与模式识别
2025-06-09 v1
摘要
密集视频预测任务(如目标跟踪和语义分割)需要能够为每个帧生成时序一致、空间稠密特征的视频编码器。然而,现有方法不足:图像编码器如 DINO 或 CLIP缺乏时序感知,而视频模型如 VideoMAE 在密集预测任务上表现不佳。我们提出 FRAME,一种为密集视频理解设计的自监督视频帧编码器。FRAME 学习从过去和当前的 RGB 帧预测当前和未来的 DINO patch 特征,从而实现空间精确、时序连贯的表示。据我们所知,FRAME 是首个利用图像模型进行密集预测且在需要细粒度视觉对应关系的任务上超越图像编码器的视频编码器。作为附加功能,FRAME 将其 class token 与 CLIP 的语义空间对齐,支持语言驱动任务如视频分类。我们在七个数据集上的六个密集预测任务中评估了 FRAME,表明其在所有任务上均优于图像编码器和现有自监督视频模型。尽管 FRAME 功能强大,但其保持紧凑的架构,使其适用于广泛的下游应用。
引用
@article{arxiv.2506.05543,
title = {FRAME: Pre-Training Video Feature Representations via Anticipation and Memory},
author = {Sethuraman TV and Savya Khosla and Vignesh Srinivasakumar and Jiahui Huang and Seoung Wug Oh and Simon Jenni and Derek Hoiem and Joon-Young Lee},
journal= {arXiv preprint arXiv:2506.05543},
year = {2025}
}