中文

基于自然语言描述定位感兴趣视频片段的注意力序列到序列翻译模型

计算机视觉与模式识别 2018-08-28 v1

摘要

我们提出了一种新颖的注意力序列到序列翻译器(ASST),用于根据自然语言描述对视频中的片段进行定位。我们做出了两点贡献。首先,我们提出了一种带有精细校准的视觉-语言注意力机制的双向循环神经网络(RNN),以全面理解自由形式的自然语言描述。该 RNN 从两个方向解析自然语言描述,注意力模型将每个有意义的单词或短语关联到每一帧,从而实现对视频内容与描述语义更细致的理解。其次,我们为网络设计了一种分层架构,以联合建模语言描述与视频内容。给定一对视频-描述,网络生成一个矩阵表示,即向量序列。矩阵中的每个向量表示由描述所约束的视频帧。这种二维表示不仅保留了帧的时间依赖性,还提供了一种执行帧级视频-语言匹配的有效方式。该分层架构以多种粒度利用视频内容,从细微细节到全局上下文。多种粒度的融合为多层级视频-语言抽象提供了鲁棒的表示。我们在两个大规模数据集上验证了 ASST 的有效性。在 DiDeMo 数据集上,我们的 ASST 在 Rank@1@1 上以 4.28%4.28\% 优于当前最优方法。在 Charades-STA 数据集上,我们在 Rank@1,IoU=0.5@1,IoU=0.5 上以 13.41%13.41\% 显著改进了当前最优方法。

关键词

引用

@article{arxiv.1808.08803,
  title  = {Attentive Sequence to Sequence Translation for Localizing Clips of Interest by Natural Language Descriptions},
  author = {Ke Ning and Linchao Zhu and Ming Cai and Yi Yang and Di Xie and Fei Wu},
  journal= {arXiv preprint arXiv:1808.08803},
  year   = {2018}
}