中文

文本到视频检索中帧选择方法的实证研究

计算机视觉与模式识别 2023-11-02 v1

摘要

文本到视频检索(TVR)旨在给定查询文本后,从大型视频库中找出最相关的视频。视频复杂而丰富的上下文对TVR的性能与效率提出了挑战。为处理序列化的视频上下文,现有方法通常选取视频中的若干帧子集来表示视频内容以用于TVR。如何选取最具代表性的帧是一个关键问题,所选取的帧不仅需保留视频的语义信息,还需通过排除时间冗余帧来提升检索效率。本文首次对TVR的帧选择进行了实证研究。我们将现有帧选择方法系统地划分为无文本引导和文本引导两类,并在此分类下详细分析了六种不同帧选择在有效性与效率方面的表现,其中有两种帧选择为本文首次提出。基于在多个TVR基准上的综合分析,我们经实证得出:采用恰当的帧选择可在不牺牲检索性能的前提下显著提升TVR的检索效率。

关键词

引用

@article{arxiv.2311.00298,
  title  = {An Empirical Study of Frame Selection for Text-to-Video Retrieval},
  author = {Mengxia Wu and Min Cao and Yang Bai and Ziyin Zeng and Chen Chen and Liqiang Nie and Min Zhang},
  journal= {arXiv preprint arXiv:2311.00298},
  year   = {2023}
}

备注

Accepted by 2023 EMNLP findings