IPFormer-VideoLLM:增强多镜头场景的多模态视频理解
计算机视觉与模式识别
2025-07-09 v2 人工智能
摘要
视频大语言模型(VideoLLM)已展现出卓越的理解能力,但在处理多镜头场景(例如具有不同摄像机角度或场景变化的视频片段)时表现不佳。这一挑战可能导致实例身份遗忘和关键帧忽略等失败情况。在本工作中,我们首先将该挑战归因于现有数据集中缺乏多镜头标注,因此我们引入了一个名为MultiClip-Bench的新数据集,其特点是为多镜头场景量身定制的密集描述和基于指令的问答对。我们通过实验发现,训练集显著提升了多镜头性能,而测试基准则为模型在多镜头场景中的能力提供了可靠的度量。通过进一步分析并发现当前模型仅以离散或有损方式编码实例特征,存在丢失身份信息的风险,我们随后提出了一种新模型IPFormer-VideoLLM。其核心思想是通过高效的基于注意力的连接器将实例级特征作为实例提示注入。这使得能够跨场景聚合实例特定信息。实验表明,我们提出的数据集和模型不仅显著增强了多场景视频理解,而且在各种视频基准上也具有明显优势。
引用
@article{arxiv.2506.21116,
title = {IPFormer-VideoLLM: Enhancing Multi-modal Video Understanding for Multi-shot Scenes},
author = {Yujia Liang and Jile Jiao and Xuetao Feng and Zixuan Ye and Yuan Wang and Zhicheng Wang},
journal= {arXiv preprint arXiv:2506.21116},
year = {2025}
}