中文

所有组合都相等吗?通过多空间学习结合文本与视觉特征进行基于文本的 video 检索

计算机视觉与模式识别 2022-11-22 v1

摘要

本文研究跨模态视频检索问题,更具体地,我们聚焦于文本到视频检索。我们探究如何将多种异构文本与视觉特征最优地组合成特征对,从而生成多个联合特征空间,将文本-视频对编码为可比较的表示。为学习这些表示,我们提出的网络架构通过遵循多空间学习过程进行训练。此外,在检索阶段,我们引入额外的softmax操作以修正推断出的查询-视频相似度。基于三个大规模数据集(IACC.3、V3C1与MSR-VTT)在多种设置下的大量实验得出了关于如何最佳组合文本-视觉特征的结论,并记录了所提网络的性能。源代码已公开于:https://github.com/bmezaris/TextToVideoRetrieval-TtimesV

关键词

引用

@article{arxiv.2211.11351,
  title  = {Are All Combinations Equal? Combining Textual and Visual Features with Multiple Space Learning for Text-Based Video Retrieval},
  author = {Damianos Galanopoulos and Vasileios Mezaris},
  journal= {arXiv preprint arXiv:2211.11351},
  year   = {2022}
}

备注

Accepted for publication; to be included in Proc. ECCV Workshops 2022. The version posted here is the "submitted manuscript" version