探索运动与表观信息用于时序句子定位
计算机视觉与模式识别
2022-01-04 v1
摘要
本文研究时序句子定位。以往工作通常通过学习的帧级视频特征并将其与文本信息对齐来解决该任务。这些工作的一个主要局限是,由于帧级特征提取,它们无法区分具有细微表观差异的模糊视频帧。最近,少数方法采用 Faster R-CNN 提取每帧中详细的对象特征以区分细粒度表观相似性。然而,Faster R-CNN 提取的对象级特征由于缺乏时间建模而缺失运动分析。为解决此问题,我们提出了一种新颖的运动-表观推理网络(MARN),它融合运动感知和表观感知的对象特征,以更好地推理对象关系并为连续帧间的活动建模。具体而言,我们首先引入两个独立的视频编码器将视频嵌入相应的运动导向和表观方面的对象表示。然后,我们开发分离的运动和表观分支分别学习运动引导和表观引导的对象关系。最后,来自两个分支的运动和表观信息被关联以生成更具代表性的特征用于最终定位。在两个具有挑战性的数据集(Charades-STA 和 TACoS)上的大量实验表明,我们提出的 MARN 大幅显著优于以往最先进的方法。
引用
@article{arxiv.2201.00457,
title = {Exploring Motion and Appearance Information for Temporal Sentence Grounding},
author = {Daizong Liu and Xiaoye Qu and Pan Zhou and Yang Liu},
journal= {arXiv preprint arXiv:2201.00457},
year = {2022}
}
备注
Accepted by AAAI2022