中文

T2VIndexer:用于高效文本-视频检索的生成式视频索引器

计算机视觉与模式识别 2024-08-22 v1

摘要

当前的文本-视频检索方法主要依赖查询与视频之间的跨模态匹配来计算相似度分数,然后进行排序以获取检索结果。该方法考虑每个候选视频与查询之间的匹配,但会产生显著的时间成本,并且随着候选数量的增加而明显增加。生成模型在自然语言处理和计算机视觉中很常见,已成功应用于文档检索,但其在多模态检索中的应用尚未被探索。为提升检索效率,本文引入了一种名为T2VIndexer的基于模型的视频索引器,它是一种序列到序列的生成模型,直接生成视频标识符并以常数时间复杂度检索候选视频。T2VIndexer旨在在保持高精度的同时减少检索时间。为实现这一目标,我们提出了视频标识符编码和查询-标识符增强方法,以在保留其语义信息的同时将视频表示为短序列。我们的方法在四个标准数据集上持续提升了当前最先进模型的检索效率。它使基线模型仅需原始检索时间的30%–50%即可在MSR-VTT(+1.0%)、MSVD(+1.8%)、ActivityNet(+1.5%)和DiDeMo(+0.2%)上取得更好的检索性能。代码可在https://github.com/Lilidamowang/T2VIndexer-generativeSearch获取。

关键词

引用

@article{arxiv.2408.11432,
  title  = {T2VIndexer: A Generative Video Indexer for Efficient Text-Video Retrieval},
  author = {Yili Li and Jing Yu and Keke Gai and Bang Liu and Gang Xiong and Qi Wu},
  journal= {arXiv preprint arXiv:2408.11432},
  year   = {2024}
}