中文

基于光流引导运动与检测外观的时间句子定位探索

计算机视觉与模式识别 2022-03-08 v1 计算与语言

摘要

时间句子定位旨在根据给定句子查询,在未裁剪视频中语义地定位目标片段。大多数先前工作专注于学习整个视频中每整帧的帧级特征,并直接将其与文本信息匹配。这种帧级特征提取导致这些方法在区分具有复杂内容和细微外观差异的模糊视频帧时存在障碍,从而限制了其性能。为了区分连续帧之间细粒度的外观相似性,一些最先进的方法额外采用如Faster R-CNN之类的检测模型,以获得每帧中详细的对象级特征,从而过滤掉冗余的背景内容。然而,这些方法由于缺乏时间建模,其Faster R-CNN中的对象检测模块导致运动分析的缺失。为缓解上述局限,本文提出一种新颖的运动与外观引导的3D语义推理网络(Motion- and Appearance-guided 3D Semantic Reasoning Network, MA3SRN),它融合了光流引导的运动感知、基于检测的外观感知以及3D感知的对象级特征,以更好地推理空间-时间对象关系,从而精确建模连续帧间的活动。具体而言,我们首先分别针对运动、外观和3D编码开发三个独立分支,以学习细粒度的运动引导、外观引导和3D感知的对象特征。然后,将相应分支的运动与外观信息相关联,以增强3D感知特征,用于最终精确接地。在三个具有挑战性的数据集(ActivityNet Caption、Charades-STA和TACoS)上的大量实验表明,所提出的MA3SRN模型达到了新的SOTA。

关键词

引用

@article{arxiv.2203.02966,
  title  = {Exploring Optical-Flow-Guided Motion and Detection-Based Appearance for Temporal Sentence Grounding},
  author = {Daizong Liu and Xiang Fang and Wei Hu and Pan Zhou},
  journal= {arXiv preprint arXiv:2203.02966},
  year   = {2022}
}

备注

arXiv admin note: text overlap with arXiv:2201.00457