ResNetVLLM -- 用于视频理解任务的多模态视觉大语言模型
计算机视觉与模式识别
2025-04-22 v1 人工智能
摘要
本文介绍了ResNetVLLM(ResNet视觉大语言模型),这是一种用于零样本视频理解的新型跨模态框架,将基于ResNet的视觉编码器与大语言模型(LLM)集成。ResNetVLLM通过避免依赖预训练的视频理解模型,而采用非预训练的ResNet来提取视觉特征,来解决零样本视频模型所面临的挑战。这种设计确保模型在统一的架构中学习视觉和语义表征,增强其从视频输入生成准确且语境相关文本描述的能力。我们的实验结果表明,ResNetVLLM在多个基准测试上实现了零样本视频理解(ZSVU)的状态突破,包括MSRVTT-QA、MSVD-QA、TGIF-QA FrameQA和ActivityNet-QA。
引用
@article{arxiv.2504.14432,
title = {ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task},
author = {Ahmad Khalil and Mahmoud Khalil and Alioune Ngom},
journal= {arXiv preprint arXiv:2504.14432},
year = {2025}
}