中文

用于基于查询的时刻定位的联合跨模态与自模态图注意力网络

计算机视觉与模式识别 2020-08-14 v2 信息检索

摘要

基于查询的时刻定位是一项新任务,旨在根据给定句子查询在未裁剪视频中定位最佳匹配片段。在该定位任务中,应更加关注对视觉与语言信息的深入挖掘。为此,我们提出了一种新颖的跨模态与自模态图注意力网络(CSMGAN),将该任务重新表述为在联合图上进行迭代消息传递的过程。具体而言,联合图由跨模态交互图(CMG)与自模态关系图(SMG)组成,其中帧与词被表示为节点,跨模态与自模态节点对之间的关系由注意力机制描述。通过参数化消息传递,CMG 突出视频与句子间的相关实例,随后 SMG 对每个模态内部的成对关系进行建模以实现帧(词)关联。借助多层此类联合图,我们的 CSMGAN 能够有效捕获两模态间的高阶交互,从而实现更精准的定位。此外,为更好理解查询中的上下文细节,我们开发了分层句子编码器以增强查询理解。在四个公开数据集上的大量实验证明了我们所提模型的有效性,且 GCSMAN 显著优于当前最优方法。

关键词

引用

@article{arxiv.2008.01403,
  title  = {Jointly Cross- and Self-Modal Graph Attention Network for Query-Based Moment Localization},
  author = {Daizong Liu and Xiaoye Qu and Xiao-Yang Liu and Jianfeng Dong and Pan Zhou and Zichuan Xu},
  journal= {arXiv preprint arXiv:2008.01403},
  year   = {2020}
}

备注

Accepted by ACM MM 2020