GroundVTS:用于视频时间定位的多模态大语言模型视觉标记采样
计算机视觉与模式识别
2026-04-03 v1
摘要
视频时间定位(VTG)是视频理解中的关键任务,也是扩展视频大语言模型(Vid-LLMs)到更广泛应用的关键能力。然而,现有的Vid-LLMs依赖于均匀帧采样来提取视频信息,导致关键帧分布稀疏,丢失至关重要的时序线索。为解决这一限制,我们提出了一种基于查询引导的粗粒度机制,用于在将视觉标记输入LLM之前筛选视觉标记,从而保留关键时空信息并维持时序连贯性。此外,我们引入了渐进优化策略,使LLM能够有效适应视觉特征的非均匀分布,增强其建模时序依赖关系的能力,以实现精确的视频定位。我们全面评估了GroundVTS在三个标准VTG基准测试上的表现,其中在时刻检索中实现了7.7分的mIoU提升,在高光检测中实现了12.0分的mAP提升。代码可在https://github.com/Florence365/GroundVTS中获得。
引用
@article{arxiv.2604.02093,
title = {GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding},
author = {Rong Fan and Kaiyan Xiao and Minghao Zhu and Liuyi Wang and Kai Dai and Zhao Yang},
journal= {arXiv preprint arXiv:2604.02093},
year = {2026}
}
备注
Published as a conference paper at CVPR 2026