深度学习用于视频-文本检索:综述
计算机视觉与模式识别
2023-02-27 v1
摘要
视频-文本检索(VTR)旨在搜索与给定句子语义最相关的视频,反之亦然。一般而言,该检索任务由四个连续步骤组成:视频与文本特征表示提取、特征嵌入与匹配,以及目标函数。最后,根据与查询的匹配相似度对从数据集中检索出的一组样本进行排序。近年来,深度学习技术取得了显著且蓬勃的进展,然而由于诸如如何学习高效时空视频特征以及如何缩小跨模态鸿沟等问题,VTR 仍是一项具有挑战性的任务。本综述中,我们回顾并总结了超过 100 篇与 VTR 相关的研究论文,展示了在数个常用基准数据集上的最优性能,并探讨了潜在挑战与方向,期望为视频-文本检索领域的研究者提供一些见解。
引用
@article{arxiv.2302.12552,
title = {Deep Learning for Video-Text Retrieval: a Review},
author = {Cunjuan Zhu and Qi Jia and Wei Chen and Yanming Guo and Yu Liu},
journal= {arXiv preprint arXiv:2302.12552},
year = {2023}
}
备注
International Journal of Multimedia Information Retrieval (IJMIR)