中文

利用显式高层语义提升视频-文本检索

计算机视觉与模式识别 2022-08-10 v2

摘要

视频-文本检索(VTR)是一项引人注目却具挑战性的多模态理解任务,旨在给定查询(视频)时搜索相关视频(文本)。现有方法通常采用完全异构的视觉-文本信息来对齐视频与文本,缺乏对所驻留于两种模态中的同质高层语义信息的感知。为弥补此不足,本文提出一种用于 VTR 的名为 HiSE 的新型视觉-语言对齐模型,其通过引入显式高层语义来改进跨模态表示。首先,我们探究显式高层语义的层次特性,并将其进一步分解为两个层级,即离散语义与整体语义。具体而言,对于视觉分支,我们利用现成的语义实体预测器生成离散高层语义;同时,采用训练好的视频描述生成模型输出整体高层语义。对于文本模态,我们将文本解析为包含事件、动作与实体的三部分。其中,事件对应整体高层语义,而动作与实体均代表离散高层语义。随后,利用不同的图推理技术促进整体与离散高层语义间的交互。大量实验表明,在显式高层语义的辅助下,我们的方法在 MSR-VTT、MSVD 和 DiDeMo 三个基准数据集上均优于最先进的方法。

关键词

引用

@article{arxiv.2208.04215,
  title  = {Boosting Video-Text Retrieval with Explicit High-Level Semantics},
  author = {Haoran Wang and Di Xu and Dongliang He and Fu Li and Zhong Ji and Jungong Han and Errui Ding},
  journal= {arXiv preprint arXiv:2208.04215},
  year   = {2022}
}

备注

Accepted by ACMMM 2022