中文

MAN:基于迭代图调整的自然语言视频时刻检索时刻对齐网络

计算机视觉与模式识别 2019-05-21 v2

摘要

本研究致力于长而未剪辑视频流中的自然语言时刻检索。该问题并非平凡,尤其当视频包含多个感兴趣时刻且语言描述复杂的时间依赖关系时,这在真实场景中经常发生。我们识别出两个关键挑战:语义错位与结构错位。然而,现有方法分别处理不同时刻,并未显式建模复杂的时刻间时间关系。本文中,我们提出时刻对齐网络(MAN),一种在单遍前馈网络中统一候选时刻编码与时间结构推理的新框架。MAN 自然地在不同的时间位置和尺度上分配与语言语义对齐的候选时刻表示。最重要的是,我们提出将时刻间时间关系显式建模为结构化图,并设计迭代图调整网络以端到端方式联合学习最佳结构。我们在两个具有挑战性的公开基准 DiDeMo 和 Charades-STA 上评估所提方法,我们的 MAN 以大幅优势显著优于最先进方法。

关键词

引用

@article{arxiv.1812.00087,
  title  = {MAN: Moment Alignment Network for Natural Language Moment Retrieval via Iterative Graph Adjustment},
  author = {Da Zhang and Xiyang Dai and Xin Wang and Yuan-Fang Wang and Larry S. Davis},
  journal= {arXiv preprint arXiv:1812.00087},
  year   = {2019}
}

备注

CVPR 2019