基于条件嵌入的视频与文本匹配
计算机视觉与模式识别
2021-10-22 v1 信息检索
摘要
我们提出一种将给定语料库中的文本句子与给定视频片段相互匹配的方法。传统视频与文本匹配通过学习共享嵌入空间实现,且一种模态的编码独立于另一种模态。本工作中,我们以考虑查询相关信息的方式对数据集数据进行编码。该方法的能力被证明源于对词与帧之间交互数据的池化。由于视频片段的编码依赖于与之比较的句子,表示需为每个潜在匹配重新计算。为此,我们提出一种高效的浅层神经网络。其训练采用可扩展至段落/视频匹配的分层三元组损失。该方法简洁、可提供可解释性,并在 ActivityNet、DiDeMo、YouCook2、MSR-VTT 与 LSMDC 五个不同数据集上以显著优势取得句子-片段与视频-文本任务的 SOTA 结果。我们还展示了我们的条件表示可迁移至视频引导的机器翻译,并在 VATEX 上改进了当前结果。源代码见 https://github.com/AmeenAli/VideoMatch。
引用
@article{arxiv.2110.11298,
title = {Video and Text Matching with Conditioned Embeddings},
author = {Ameen Ali and Idan Schwartz and Tamir Hazan and Lior Wolf},
journal= {arXiv preprint arXiv:2110.11298},
year = {2021}
}