中文

视觉语言模型学习超图像以实现高效的部分相关视频检索

计算机视觉与模式识别 2024-03-13 v2 多媒体

摘要

本文中,我们提出一种高效且高性能的部分相关视频检索方法,旨在检索包含至少一个与输入文本查询相关片段的长视频。其挑战在于使用视觉骨干网络编码密集帧。这要求模型处理增多的帧数,导致长视频的巨大计算开销。为缓解开销,先前研究使用轻量视觉骨干网络,因其能力有限而产生次优检索性能。然而,由于大型视觉语言模型(VLM)效率低,直接以其替换骨干网络并不可取。为化解此困境,我们摒弃密集帧,转而关注超图像——通过将视频帧以 N×NN \times N 网格布局重排而生成。这将视觉编码数量降至 1N2\frac{1}{N^2},缓解了大型 VLM 的低效。基于该思路,我们做出两点贡献。首先,我们探究 VLM 在零样本设定下对超图像的泛化能力。为此,我们提出一种称为查询注意力超图像检索(QASIR)的方法,其关注与输入查询相关的部分片段。零样本 QASIR 带来两点发现:(1)其使 VLM 泛化至超图像;(2)网格尺寸 NN、图像分辨率与 VLM 规模为性能与计算开销间的关键权衡参数。其次,我们引入微调及混合 QASIR,结合高效与低效模型以平衡性能与计算开销。这揭示两点发现:(1)微调 QASIR 增强 VLM 对超图像的有效学习;(2)混合 QASIR 在降低计算开销的同时将大型 VLM 的性能下降最小化。

关键词

引用

@article{arxiv.2312.00414,
  title  = {Vision-Language Models Learn Super Images for Efficient Partially Relevant Video Retrieval},
  author = {Taichi Nishimura and Shota Nakada and Masayoshi Kondo},
  journal= {arXiv preprint arXiv:2312.00414},
  year   = {2024}
}

备注

24 pages