面向高效视频语言预训练的聚类级时空掩码策略
计算机视觉与模式识别
2026-03-25 v1
摘要
大规模视频语言预训练可实现跨多模态任务的强大推理能力,但常常导致计算成本的严重限制。尽管近期在掩码视觉建模方面的进展有所缓解,但仍然存在两个根本局限:高掩码比例下严重的视觉信息丢失,以及由帧间相关性引起的时序信息泄露。为此,我们提出ClusterSTM,即一种用于高效视频语言预训练的聚类级时空掩码策略。ClusterSTM首先对帧内进行聚类,将视觉标记划分为多个语义独立的聚类,然后通过保留每个聚类中具有最高时序密度的标记来执行聚类级掩码。我们的掩码策略确保保留的标记捕获整体视频内容,同时表现出强烈的时序相关性。此外,我们引入一种视频文本相关性重建目标,对高层次多模态语义进行对齐,超越传统的视觉重建。广泛的实验表明,ClusterSTM在视频文本检索、视频问答和视频描述生成等任务上实现了卓越的性能,建立了高效视频语言模型的新型最佳结果。
引用
@article{arxiv.2603.22953,
title = {Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining},
author = {Weijun Zhuang and Yuqing Huang and Weikang Meng and Xin Li and Ming Liu and Xiaopeng Hong and Yaowei Wang and Wangmeng Zuo},
journal= {arXiv preprint arXiv:2603.22953},
year = {2026}
}
备注
Accepted by CVPR 2026