三思而后行:基于视频大语言模型的语义导向视频时序定位方法
计算机视觉与模式识别
2026-02-17 v2
摘要
通过自然语言在时间上定位用户查询的事件是视频模型的一项关键能力。近期方法主要适应视频大语言模型以生成事件边界时间戳来完成时序定位任务,但由于时间戳输出的信息匮乏性,这些方法难以利用 LLM 预训练的语义理解能力。在本工作中,我们探索了一种无时间戳的语义导向框架,通过两个生成式学习任务和一个判别式学习任务对视频 LLM 进行微调。我们首先引入了一项结构化 token 生成任务,使视频 LLM 能够根据输入查询识别输入视频的时序结构。通过该任务,视频 LLM 生成一系列称为结构化 token 的特殊 token,将视频划分为连续的片段,并将其分类为目标事件或背景过渡。为了增强对事件片段的精确识别,我们进一步提出了一项查询聚焦的描述生成任务,使视频 LLM 能够提取可被结构化 token 有效利用的细粒度事件语义。最后,我们引入了一个由对比学习驱动的结构化 token 定位模块,将每个结构化 token 与其对应的视频片段相关联,实现对输入视频的整体时序分割,并直接得出用于定位的目标事件片段。在多种时序定位任务上的大量实验表明,我们提出的框架 MeCo 始终优于依赖边界时间戳生成的方法,凸显了语义驱动方法在利用视频 LLM 进行时序定位方面的潜力。
引用
@article{arxiv.2503.09027,
title = {Measure Twice, Cut Once: A Semantic-Oriented Approach to Video Temporal Localization with Video LLMs},
author = {Zongshang Pang and Mayu Otani and Yuta Nakashima},
journal= {arXiv preprint arXiv:2503.09027},
year = {2026}
}
备注
ICLR2026