中文

用于视频时序语言定位的多模态交互图卷积网络

计算机视觉与模式识别 2021-10-13 v1

摘要

本文致力于解决视频中的时序语言定位问题,旨在未剪辑视频中识别由自然语言句子所描述的时刻的起止点。然而这并非易事,因为它不仅要求对视频与句子查询的全面理解,还要求准确捕捉它们之间的语义对应。现有工作主要集中于探索视频片段与查询词之间的顺序关系来推理视频与句子查询,忽视了其他模态内关系(例如视频片段间的语义相似度与查询词间的句法依赖)。为此,本工作中我们提出多模态交互图卷积网络(MIGCN),其联合探索视频与句子查询中存在的复杂模态内关系与模态间交互,以促进对视频与句子查询的理解与语义对应捕捉。此外,我们设计了一种自适应上下文感知定位方法,将上下文信息引入候选时刻,并设计多尺度全连接层对不同长度的生成的粗粒度候选时刻进行排序与边界调整。在 Charades-STA 与 ActivityNet 数据集上的大量实验证明了我们模型优异的性能与更高的效率。

关键词

引用

@article{arxiv.2110.06058,
  title  = {Multi-Modal Interaction Graph Convolutional Network for Temporal Language Localization in Videos},
  author = {Zongmeng Zhang and Xianjing Han and Xuemeng Song and Yan Yan and Liqiang Nie},
  journal= {arXiv preprint arXiv:2110.06058},
  year   = {2021}
}

备注

Accepted by IEEE Transactions on Image Processing