SHE-Net:语法层次增强的文本-视频检索
计算机视觉与模式识别
2025-02-25 v3 信息检索
摘要
近年来,短视频应用的用户基础经历了前所未有的增长,导致对视频内容分析的需求显著增加。特别是文本-视频检索,其目标是从海量视频语料库中根据文本描述找到最匹配的视频,是一项基本功能,其主要挑战是弥合模态差距。然而,大多数现有方法仅将文本视为离散标记,而忽略了其语法结构。此外,由于缺乏与文本的交互,视频中丰富的空间和时间线索往往未被充分利用。为了解决这些问题,我们认为使用文本作为指导来关注视频中的相关时间帧和空间区域是有益的。在本文中,我们提出了一种新颖的语法层次增强的文本-视频检索方法(SHE-Net),该方法利用文本固有的语义和语法层次,从两个角度弥合模态差距。首先,为了促进视觉内容的更细粒度整合,我们利用揭示文本描述语法结构的文本语法层次来指导视觉表示。其次,为了进一步增强多模态交互和对齐,我们还利用语法层次来指导相似度计算。我们在四个公开的文本-视频检索数据集MSR-VTT、MSVD、DiDeMo和ActivityNet上评估了我们的方法。实验结果和消融研究证实了我们提出的方法的优势。
引用
@article{arxiv.2404.14066,
title = {SHE-Net: Syntax-Hierarchy-Enhanced Text-Video Retrieval},
author = {Xuzheng Yu and Chen Jiang and Xingning Dong and Tian Gan and Ming Yang and Qingpei Guo},
journal= {arXiv preprint arXiv:2404.14066},
year = {2025}
}