Cap4Video:辅助字幕能为文本-视频检索做什么?
计算机视觉与模式识别
2023-03-29 v3
摘要
大多数现有的文本-视频检索方法聚焦于视频视觉内容与文本查询句子之间的跨模态匹配。然而,在真实场景中,在线视频常伴随相关文本信息(如标题、标签甚至字幕),这些信息可用于匹配文本查询。这一洞察促使我们提出一种新颖的文本-视频检索方法:利用来自网络规模预训练模型(如 CLIP 和 GPT-2)的知识,通过零样本视频字幕生成直接从视频中产生关联字幕。给定生成的字幕,一个自然的问题随之而来:它们为文本-视频检索带来了哪些益处?为回答此问题,我们引入 Cap4Video,一种以三种方式利用字幕的新框架:i) 输入数据:视频-字幕对可扩充训练数据。ii) 中间特征交互:我们在视频与字幕之间进行跨模态特征交互,以产生增强的视频表示。iii) 输出分数:查询-字幕匹配分支可补充原有的查询-视频匹配分支用于文本-视频检索。我们进行了全面的消融实验以证明方法的有效性。无需任何后处理,Cap4Video 在四个标准文本-视频检索基准上取得了 SOTA 性能:MSR-VTT (51.4%)、VATEX (66.6%)、MSVD (51.8%) 和 DiDeMo (52.0%)。代码见 https://github.com/whwu95/Cap4Video。
引用
@article{arxiv.2301.00184,
title = {Cap4Video: What Can Auxiliary Captions Do for Text-Video Retrieval?},
author = {Wenhao Wu and Haipeng Luo and Bo Fang and Jingdong Wang and Wanli Ouyang},
journal= {arXiv preprint arXiv:2301.00184},
year = {2023}
}
备注
Accepted by CVPR 2023. Selected as a Highlight (Top 2.5% of ALL submissions)