视觉语言模型学习超图像以实现高效的部分相关视频检索
计算机视觉与模式识别
2024-03-13 v2 多媒体
摘要
本文中,我们提出一种高效且高性能的部分相关视频检索方法,旨在检索包含至少一个与输入文本查询相关片段的长视频。其挑战在于使用视觉骨干网络编码密集帧。这要求模型处理增多的帧数,导致长视频的巨大计算开销。为缓解开销,先前研究使用轻量视觉骨干网络,因其能力有限而产生次优检索性能。然而,由于大型视觉语言模型(VLM)效率低,直接以其替换骨干网络并不可取。为化解此困境,我们摒弃密集帧,转而关注超图像——通过将视频帧以 网格布局重排而生成。这将视觉编码数量降至 ,缓解了大型 VLM 的低效。基于该思路,我们做出两点贡献。首先,我们探究 VLM 在零样本设定下对超图像的泛化能力。为此,我们提出一种称为查询注意力超图像检索(QASIR)的方法,其关注与输入查询相关的部分片段。零样本 QASIR 带来两点发现:(1)其使 VLM 泛化至超图像;(2)网格尺寸 、图像分辨率与 VLM 规模为性能与计算开销间的关键权衡参数。其次,我们引入微调及混合 QASIR,结合高效与低效模型以平衡性能与计算开销。这揭示两点发现:(1)微调 QASIR 增强 VLM 对超图像的有效学习;(2)混合 QASIR 在降低计算开销的同时将大型 VLM 的性能下降最小化。
引用
@article{arxiv.2312.00414,
title = {Vision-Language Models Learn Super Images for Efficient Partially Relevant Video Retrieval},
author = {Taichi Nishimura and Shota Nakada and Masayoshi Kondo},
journal= {arXiv preprint arXiv:2312.00414},
year = {2024}
}
备注
24 pages