视觉专家集成的全局-局部对齐视频描述 GLaVE-Cap
计算机视觉与模式识别
2025-09-16 v1
摘要
视频详细描述旨在生成全面视频描述以促进视频理解。近期大多数视频详细描述社区的工作均致力于局部到全局范式,即先从视频片段生成局部描述,再总结为全局描述。然而,我们发现该范式导致描述不够详细且上下文不一致,原因在于(1)缺乏确保细粒度描述的机制,以及(2)局部和全局描述之间的相互作用较弱。为弥补上述问题,我们提出GLaVE-Cap:一种集成视觉专家的全局-局部分对齐框架,用于视频描述。其包含两个核心模块:TrackFusion利用视觉专家获取跨帧视觉提示,配合双流结构,实现全面局部分析;CaptionBridge建立局部分析与全局描述的交互,利用全局上下文指导局部分析,并自适应地将局部分析概括为连贯的全局描述。此外,我们构建了GLaVE-Bench:一个综合性视频描述基准,每个视频拥有现有基准的5倍查询,涵盖多样化视觉维度以促进可靠评估。我们进一步提供了包含16K高质量细粒度视频描述和120万个相关问答对的训练数据集GLaVE-1.2M。在四个基准上的大量实验表明,GLaVE-Cap实现了最先进的性能。此外,消融实验和学生模型分析进一步验证了所提模块的有效性以及GLaVE-1.2M对视频理解社区的贡献。源代码、模型权重、基准和数据集将开源。
引用
@article{arxiv.2509.11360,
title = {GLaVE-Cap: Global-Local Aligned Video Captioning with Vision Expert Integration},
author = {Wan Xu and Feng Zhu and Yihan Zeng and Yuanfan Guo and Ming Liu and Hang Xu and Wangmeng Zuo},
journal= {arXiv preprint arXiv:2509.11360},
year = {2025}
}