理解文本到视频检索中的性能平台期:全面经验与语言学分析
信息检索
2026-05-05 v1 计算机视觉与模式识别
机器学习
多媒体
摘要
文本到视频检索使用户能够使用自然语言查询查找相关视频内容,这一任务因在线视频的快速扩张而日益重要。过去六年间,研究产生了诸多方法,包括双编码器、注意力驱动模型与多模态融合方法;然而,关于模型行为、数据集影响以及查询难度的根本问题仍待解答。本文在统一的预处理与评估框架下,评估了 14 种最先进检索方法,涵盖 3 个广泛使用的数据集。我们分析了标题特征,包括长度、清晰度、语义类别以及 Action 与 Scene 的平衡,并将其与模型性能关联。我们的结果表明,短而清晰、简单的标题(例如描述单个动作或颜色属性的标题)可获得更高的召回率,而复杂事件、多步骤活动或细粒度场景描述则对所有现有模型而言都具有挑战性。注意力驱动的架构更好地处理时序相关或多步骤查询,而双编码器与多模态融合模型主要在更简单或单类别标题上表现良好。跨数据集泛化随更大更具多样性的标题集合而提升,但生成式标题并不一致地提升检索准确度。总体而言,我们的发现揭示了关键数据集因素、基准挑战以及查询内容与模型架构之间的相互作用,为开发更有效的文本到视频检索系统提供了指导。
引用
@article{arxiv.2605.00826,
title = {Understanding the Performance Plateau in Text-to-Video Retrieval: A Comprehensive Empirical and Linguistic Analysis},
author = {Maria-Eirini Pegia and Dimitrios Stefanopoulos and Björn Þór Jónsson and Anastasia Moumtzidou and Ilias Gialampoukidis and Stefanos Vrochidis and Ioannis Kompatsiaris},
journal= {arXiv preprint arXiv:2605.00826},
year = {2026}
}
备注
Survey, 50 pages, 15 figures, 13 tables, 154 citations