中文

利用辅助信息进行文本到视频检索:综述

计算机视觉与模式识别 2025-06-02 v1

摘要

文本到视频(T2V)检索旨在根据用户的文本查询,从视频库中识别出最相关的条目。传统方法仅依赖对齐视频和文本模态来计算相似度并检索相关条目。然而,最新进展强调结合从视频和文本模态中提取的辅助信息,以提高检索性能并弥合这些模态之间的语义鸿沟。辅助信息可以包括视觉属性(如物体)、时间与空间上下文,以及文本描述(如语音和改写后的字幕)。本综述全面回顾了 81 篇利用此类辅助信息的文本到视频检索研究论文。它详细分析了它们的方法论;重点介绍了在基准数据集上的 SOTA 结果;并讨论了可用的数据集及其辅助信息。此外,它提出了未来研究的有前景的方向,重点关注利用这些信息进一步提升检索性能的不同方式。

关键词

引用

@article{arxiv.2505.23952,
  title  = {Leveraging Auxiliary Information in Text-to-Video Retrieval: A Review},
  author = {Adriano Fragomeni and Dima Damen and Michael Wray},
  journal= {arXiv preprint arXiv:2505.23952},
  year   = {2025}
}