中文

超越粗粒度匹配:视频-文本检索中的细粒度评估

计算机视觉与模式识别 2024-10-18 v2 计算与语言 多媒体

摘要

视频-文本检索已取得显著进展,但模型辨别细微 caption 差异的能力仍需验证。本文引入一种新方法进行细粒度评估。该方法可自动为现有数据集生成带细微单词变体的硬负检索 caption,涵盖名词、动词、形容词、副词和介词。我们在四个最新模型上进行了全面实验,分别使用两个标准基准数据集 (MSR-VTT 和 VATEX) 和两个特别精选的数据集 (VLN-UVO 和 VLN-OOPS),其中包含详细描述。实验结果带来了若干新见解:1) 我们的分析表明当前评估基准不足以检测模型辨别细微单词差异的能力;2) 我们的细粒度评估凸显了模型在区分此类细微变体方面的困难。为增强细粒度理解,我们提出一种可轻松与当前方法集成的新基线。我们在细粒度评估上的实验表明,该方法提升了模型理解细粒度差异的能力。

关键词

引用

@article{arxiv.2410.12407,
  title  = {Beyond Coarse-Grained Matching in Video-Text Retrieval},
  author = {Aozhu Chen and Hazel Doughty and Xirong Li and Cees G. M. Snoek},
  journal= {arXiv preprint arXiv:2410.12407},
  year   = {2024}
}

备注

Accepted to ACCV 2024