语义条件动态调制用于视频中的时间句子定位
计算机视觉与模式识别
2019-11-01 v1
摘要
视频中的时间句子定位旨在检测并定位一个与给定句子语义对应的目标视频片段。现有方法主要通过匹配和对齐句子与候选视频片段之间的语义来处理该任务,而忽略了句子信息在时间上关联和组合视频中描述内容的重要作用。本文提出了一种新颖的语义条件动态调制(SCDM)机制,该机制依赖句子语义来调制时间卷积操作,从而更好地在时间上关联和组合与句子相关的视频内容。更重要的是,所提出的 SCDM 根据不同的视频内容动态执行,以建立句子与视频之间更精确的匹配关系,从而提高时间定位精度。在三个公开数据集上的大量实验表明,我们的模型以明显优势超越了最先进方法,展示了 SCDM 在时间句子定位中更好地关联和定位相关视频内容的能力。本文代码可在 https://github.com/yytzsy/SCDM 获取。
引用
@article{arxiv.1910.14303,
title = {Semantic Conditioned Dynamic Modulation for Temporal Sentence Grounding in Videos},
author = {Yitian Yuan and Lin Ma and Jingwen Wang and Wei Liu and Wenwu Zhu},
journal= {arXiv preprint arXiv:1910.14303},
year = {2019}
}