MobileViCLIP:面向移动设备的高效视频文本模型
计算机视觉与模式识别
2025-08-12 v1
摘要
高效轻量级神经网络因其更快的推理速度和更易在移动设备上部署而受到越来越多的关注。然而,现有的视频预训练模型仍集中于具有高延迟的常规ViT架构,少有工作尝试在移动设备上构建高效架构。本文通过在高质量大规模视频文本数据集上训练,将时序结构重参数化引入高效图像文本模型,从而构建出可在移动设备上运行且具有强大零样本分类和检索能力的高效视频文本模型,称为MobileViCLIP。具体而言,针对移动设备上的推理速度,我们的MobileViCLIP-Small比InternVideo2-L14快55.4倍,比InternVideo2-S14快6.7倍。针对零样本检索性能,我们的MobileViCLIP-Small在MSR-VTT上获得与InternVideo2-L14相似的性能,并比InternVideo2-S14提升6.9%。代码已公开于https://github.com/MCG-NJU/MobileViCLIP。
引用
@article{arxiv.2508.07312,
title = {MobileViCLIP: An Efficient Video-Text Model for Mobile Devices},
author = {Min Yang and Zihan Jia and Zhilin Dai and Sheng Guo and Limin Wang},
journal= {arXiv preprint arXiv:2508.07312},
year = {2025}
}
备注
Accepted by ICCV2025