基于元优化帧的高效跨模态视频检索
计算机视觉与模式识别
2022-10-18 v1
摘要
跨模态视频检索旨在给定文本查询时检索语义相关的视频,是多媒体的基础任务之一。大多数性能最优的方法主要利用视觉Transformer(ViT)提取视频特征[1, 2, 3],但受限于ViT的高计算复杂度,尤其在处理长视频时。一种常见且简单的解决方案是从视频中均匀采样少量(如4或8)帧(而非使用整个视频)作为ViT的输入。帧数对ViT性能影响显著,例如使用8帧优于4帧但需更多计算资源,从而存在权衡。为摆脱该权衡,本文提出一种基于双层优化程序(BOP)的自动视频压缩方法,包含模型级(即基础级)与帧级(即元级)优化。模型级学习一个跨模态视频检索模型,其输入为由帧级优化学习到的“压缩帧”。反之,帧级优化通过梯度下降,利用在整个视频上计算的视频检索模型的元损失完成。我们将此BOP方法及“压缩帧”称为元优化帧(MOF)。通过引入MOF,视频检索模型能够利用整个视频的信息(用于训练),而实际部署仅取少量输入帧。MOF的收敛性由元梯度下降算法保证。为评估,我们在三个大规模基准MSR-VTT、MSVD和DiDeMo上进行了广泛的跨模态视频检索实验。结果表明,MOF是一种通用且高效的方法,可提升多种基线方法,并达到新的最先进性能。
引用
@article{arxiv.2210.08452,
title = {Efficient Cross-Modal Video Retrieval with Meta-Optimized Frames},
author = {Ning Han and Xun Yang and Ee-Peng Lim and Hao Chen and Qianru Sun},
journal= {arXiv preprint arXiv:2210.08452},
year = {2022}
}