中文

利用视觉语义推理进行视频-文本检索

计算机视觉与模式识别 2020-06-17 v1

摘要

视频检索是连接视觉与语言领域的具有挑战性的研究课题,近年来引起了广泛关注。先前的工作致力于通过直接从帧级特征编码来表示视频。事实上,视频包含各种丰富的语义关系,现有方法较少关注这些关系。为解决此问题,我们提出视觉语义增强推理网络(ViSERN)以利用帧区域间的推理。具体而言,我们将帧区域视为顶点并构建全连接的语义关联图。然后,我们通过基于新颖随机游走规则的图卷积网络进行推理,以生成涉及语义关系的区域特征。借助推理的优势,区域间的语义交互被考虑,同时冗余的影响被抑制。最后,区域特征被聚合以形成帧级特征用于进一步编码,从而度量视频-文本相似度。在两个公开基准数据集上的大量实验验证了我们的方法因强大的语义推理而取得最先进性能的有效性。

关键词

引用

@article{arxiv.2006.08889,
  title  = {Exploiting Visual Semantic Reasoning for Video-Text Retrieval},
  author = {Zerun Feng and Zhimin Zeng and Caili Guo and Zheng Li},
  journal= {arXiv preprint arXiv:2006.08889},
  year   = {2020}
}

备注

Accepted by IJCAI 2020. SOLE copyright holder is IJCAI (International Joint Conferences on Artificial Intelligence), all rights reserved. http://static.ijcai.org/2020-accepted_papers.html