中文

无掩码教师:面向训练高效的视频基础模型

计算机视觉与模式识别 2024-03-12 v2

摘要

视频基础模型(VFMs)由于高计算成本和数据稀缺而鲜有探索。先前的VFM依赖于图像基础模型(IFMs),其在迁移至视频领域时面临挑战。尽管VideoMAE已从有限数据训练出鲁棒的ViT,但其底层重建带来收敛困难并与高层跨模态对齐相冲突。本文提出一种面向时间敏感VFM的训练高效方法,整合了现有方法的优势。为提高数据效率,我们掩码掉大多数低语义视频令牌,但选择性地将无掩码令牌与IFM对齐,其作为无掩码教师(UMT)。通过提供语义引导,我们的方法实现了更快收敛和多模态友好性。借助渐进式预训练框架,我们的模型可处理包括场景相关、时间相关和复杂视频-语言理解在内的多种任务。仅在公开源数据上以32块A100 GPU预训练6天,我们从头构建的ViT-L/16在各种视频任务上取得了最先进性能。代码与模型将发布于https://github.com/OpenGVLab/unmasked_teacher。

关键词

引用

@article{arxiv.2303.16058,
  title  = {Unmasked Teacher: Towards Training-Efficient Video Foundation Models},
  author = {Kunchang Li and Yali Wang and Yizhuo Li and Yi Wang and Yinan He and Limin Wang and Yu Qiao},
  journal= {arXiv preprint arXiv:2303.16058},
  year   = {2024}
}

备注

ICCV2023