TinyLLaVA-Video:面向视频理解的小型多模态大模型与分组重采样器
计算机视觉与模式识别
2025-06-11 v2
摘要
视频行为识别和场景理解是多模态智能中的基础任务,是众多实际应用的关键构建模块。尽管大型多模态模型(LMMs)已取得显著进展,但大多数现有开源模型依赖超过 7B 参数并需要大规模数据集进行训练,这使得它们资源密集且对许多研究者不可及。此外,轻量级模型在处理长视觉序列和时间理解方面面临持续挑战。在这项工作中,我们介绍了 TinyLLaVA-Video,一个约 3.6B 参数的轻量级但强大的视频理解模型。我们设计的核心是视频级分组重采样器,这是一种新颖的机制,可在视频级别显著减少并控制视觉 token 的数量。与传统的图像级重采样器不同,我们的方法在增强时间理解的同时有效缓解冗余,从而提升视频任务性能。此外,TinyLLaVA-Video 展现出卓越的效率,仅需在 8 块 A100-40G GPU 上训练一天。它在多个基准上超越了若干现有的 7B 参数模型。我们相信这项工作为轻量级视频理解模型的未来研究提供了宝贵基础。代码和权重可在 https://github.com/ZhangXJ199/TinyLLaVA-Video 获取。
引用
@article{arxiv.2501.15513,
title = {TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler},
author = {Xingjian Zhang and Xi Weng and Yihao Yue and Zhaoxin Fan and Wenjun Wu and Lei Huang},
journal= {arXiv preprint arXiv:2501.15513},
year = {2025}
}
备注
code and training recipes are available at https://github.com/ZhangXJ199/TinyLLaVA-Video