中文

基于冻结视觉语言模型的零样本视频时刻检索

计算机视觉与模式识别 2023-09-06 v1

摘要

准确的视频时刻检索(VMR)需要能够处理未知词汇和未见场景的通用视觉-文本相关性。然而,当从有限的时刻-文本数据(由于标注成本过高难以扩展,即全监督)中学习时,所得相关性可能存在偏差;而当仅有视频-文本成对关系而缺乏细粒度时间标注(即弱监督)时,相关性则不可靠。近来,视觉语言模型(VLM)展示了一种从大规模视觉语言成对网络数据中导出通用视觉-文本相关性的迁移学习新范式,该范式通过目标域微调也为VMR带来增益。本工作中,我们提出一种零样本方法,将任意VLM的通用视觉-文本先验适配于促进时刻-文本对齐,无需访问VMR数据。为此,我们设计了一个条件特征精炼模块,基于文本查询生成边界感知的视觉特征,以实现更好的时刻边界理解。此外,我们设计了一种自底向上的候选生成策略,缓解领域差异影响,并将复杂查询检索任务分解为独立动作检索,从而最大化VLM的益处。在三个VMR基准数据集上的大量实验表明,我们的零样本算法具有显著的性能优势,尤其在新词和新位置的分布外设定下。

关键词

引用

@article{arxiv.2309.00661,
  title  = {Zero-Shot Video Moment Retrieval from Frozen Vision-Language Models},
  author = {Dezhao Luo and Jiabo Huang and Shaogang Gong and Hailin Jin and Yang Liu},
  journal= {arXiv preprint arXiv:2309.00661},
  year   = {2023}
}

备注

Accepted by WACV 2024