Mobile-VideoGPT:移动端视频理解的快速且精准的模型
计算机视觉与模式识别
2026-03-20 v2
摘要
视频理解模型常常在计算需求高、参数数量大以及推理速度慢方面表现不佳,难以满足实际应用的效率要求。为此,我们提出 Mobile-VideoGPT,一个旨在使用不足一百万参数的高效多模态框架。不同于传统视频大型多模态模型(LMM),Mobile-VideoGPT 由轻量级双视觉编码器、高效投影器和小型语言模型(SLM)组成,实现实时吞吐。为进一步提高效率,我们提出基于注意力的帧评分机制以选择关键帧,同时开发高效 token 投影器以修剪冗余视觉 token,保留关键上下文线索。我们在广为人知的六个视频理解基准测试上评估了该模型(例如 MVBench、EgoSchema、NextQA 和 PercepTest)。我们的结果表明,Mobile-VideoGPT-0.5B 可实现每秒 46 个 token 的生成速度,平均超过现有 0.5B 参数的 SOTA 模型提升 6 分,参数减少 40%,吞向提升 2 倍以上。我们的代码和模型已公开:https://github.com/Amshaker/Mobile-VideoGPT。
引用
@article{arxiv.2503.21782,
title = {Mobile-VideoGPT: Fast and Accurate Model for Mobile Video Understanding},
author = {Abdelrahman Shaker and Muhammad Maaz and Chenhui Gou and Hamid Rezatofighi and Salman Khan and Fahad Shahbaz Khan},
journal= {arXiv preprint arXiv:2503.21782},
year = {2026}
}
备注
Technical Report. Project: https://amshaker.github.io/Mobile-VideoGPT