基于变分多模态超图网络的文本 - 视频检索
计算机视觉与模式识别
2024-01-09 v1 计算与语言
摘要
文本 - 视频检索是一项具有挑战性的任务,旨在根据文本查询识别相关视频。与传统文本检索相比,文本 - 视频检索的主要障碍在于查询的文本性质与视频内容的视觉丰富性之间的语义鸿沟。以往的工作主要通过精细聚合词 - 帧匹配信号来聚焦于查询与视频的对齐。受人类模块化判断文本与视频相关性的认知过程启发,由于视频内容的连续性和复杂性,这种判断需要高阶匹配信号。在本文中,我们提出了块级文本 - 视频匹配方法,其中提取查询块以描述特定的检索单元,并将视频分割为不同的片段。我们将块级匹配形式化为查询词与视频帧之间的 n 元相关性建模,并引入多模态超图进行 n 元相关性建模。通过将文本单元和视频帧表示为节点,并使用超边描绘它们之间的关系,构建了多模态超图。通过这种方式,查询和视频可以在高阶语义空间中对齐。此外,为了增强模型的泛化能力,提取的特征被输入到变分推断组件中进行计算,从而获得高斯分布下的变分表示。超图和变分推断的结合使得我们的模型能够捕捉文本和视觉内容之间复杂的 n 元交互。实验结果表明,我们提出的方法在文本 - 视频检索任务上达到了最先进 (SOTA) 的性能。
引用
@article{arxiv.2401.03177,
title = {Text-Video Retrieval via Variational Multi-Modal Hypergraph Networks},
author = {Qian Li and Lixin Su and Jiashu Zhao and Long Xia and Hengyi Cai and Suqi Cheng and Hengzhu Tang and Junfeng Wang and Dawei Yin},
journal= {arXiv preprint arXiv:2401.03177},
year = {2024}
}