所有组合都相等吗?通过多空间学习结合文本与视觉特征进行基于文本的 video 检索
计算机视觉与模式识别
2022-11-22 v1
摘要
本文研究跨模态视频检索问题,更具体地,我们聚焦于文本到视频检索。我们探究如何将多种异构文本与视觉特征最优地组合成特征对,从而生成多个联合特征空间,将文本-视频对编码为可比较的表示。为学习这些表示,我们提出的网络架构通过遵循多空间学习过程进行训练。此外,在检索阶段,我们引入额外的softmax操作以修正推断出的查询-视频相似度。基于三个大规模数据集(IACC.3、V3C1与MSR-VTT)在多种设置下的大量实验得出了关于如何最佳组合文本-视觉特征的结论,并记录了所提网络的性能。源代码已公开于:https://github.com/bmezaris/TextToVideoRetrieval-TtimesV
引用
@article{arxiv.2211.11351,
title = {Are All Combinations Equal? Combining Textual and Visual Features with Multiple Space Learning for Text-Based Video Retrieval},
author = {Damianos Galanopoulos and Vasileios Mezaris},
journal= {arXiv preprint arXiv:2211.11351},
year = {2022}
}
备注
Accepted for publication; to be included in Proc. ECCV Workshops 2022. The version posted here is the "submitted manuscript" version