GranAlign:面向零样本视频时序检索的细粒度感知对齐框架
计算机视觉与模式识别
2026-01-05 v1
摘要
零样本视频时序检索(Zero-shot video moment retrieval, ZVMR)是指在不依赖于任务特定训练数据的情况下,使用自然语言查询在未裁剪视频中定位时间片段的任务。在此设置下,主要挑战在于文本查询与视觉内容之间的语义细粒度不匹配。以往ZVMR研究尝试通过利用代表视频和语言在联合空间中的高质量预训练知识来实现对齐。然而,这些方法未能在给定场景下平衡每个模态提供的预训练知识之间的语义细粒度。结果尽管每个模态的表征质量都很高,但细粒度的不匹配导致检索不准确。本文提出了一种训练无关的框架,称为细粒度感知对齐(GranAlign),以桥接粗糙与细粒度语义表征之间的差距。我们的ethods引入两种互补技术:基于细粒度的查询改写以生成多样的语义细粒度,以及查询感知的标题生成以将查询意图嵌入视频内容。通过将多级查询与查询无关和查询感知的标题配对,我们有效解决了语义不匹配。结果,我们的方法在所有三个主要基准(QVHighlights、Charades-STA、ActivityNet-Captions)上均设立了新的状态, 在具有挑战性的QVHighlights数据集上实现了约3.23%的mAP@avg提升。
引用
@article{arxiv.2601.00584,
title = {GranAlign: Granularity-Aware Alignment Framework for Zero-Shot Video Moment Retrieval},
author = {Mingyu Jeon and Sunjae Yoon and Jonghee Kim and Junyeoung Kim},
journal= {arXiv preprint arXiv:2601.00584},
year = {2026}
}
备注
Accepted to AAAI 2026