MSJoE:联合演化MLLM与抽样器以实现高效长视频理解
计算机视觉与模式识别
2026-02-27 v1
摘要
高效理解长视频仍是多模态大语言模型(MLLM)的核心挑战。本文提出了多模态大语言模型-抽样器联合演化(MSJoE)框架,联合演化MLLM与轻量级关键帧抽样器以高效理解长视频。MSJoE基于以下核心假设:仅有一小部分关键帧对回答视频问题至关重要。具体而言,MSJoE首先推理出若干查询,这些查询描述与问题相关的多样化视角。随后,这些查询与冻结的CLIP模型交互,生成查询-帧相似度矩阵。最后,轻量级抽样器从该矩阵预测关键帧抽样权重,选取一组紧凑且信息丰富的帧,送入MLLM进行答案生成。MLLM与抽样器通过强化学习联合优化,实现查询推理、帧抽样与关键帧理解的协同适应。为支持训练,收集了包含2.8K个视频、7K个问答对的长视频问答数据集。在VideoMME、LongVideoBench、LVBench和MLVU上进行大规模实验,结果显示MSJoE相较于基线MLLM提升8.0%准确率,优于最强基线方法1.1%。
引用
@article{arxiv.2602.22932,
title = {MSJoE: Jointly Evolving MLLM and Sampler for Efficient Long-Form Video Understanding},
author = {Wenhui Tan and Xiaoyi Yu and Jiaze Li and Yijing Chen and Jianzhong Ju and Zhenbo Luo and Ruihua Song and Jian Luan},
journal= {arXiv preprint arXiv:2602.22932},
year = {2026}
}
备注
Accepted by CVPR2026