中文

基于注意力机制追踪目标与行为的时间句子定位

计算机视觉与模式识别 2023-02-22 v1

摘要

时间句子定位(TSG)旨在从未剪辑视频中定位与自然语言查询在语义上对齐的时间片段。大多数现有方法在常规TSG框架下通过3D卷积网络或检测网络提取帧粒度特征或对象粒度特征,未能捕捉帧间的细微差异或建模核心人物/对象的时空行为。本文引入一种新视角,通过追踪关键对象与活动来学习更细粒度的时空行为以解决TSG任务。具体而言,我们提出一种新颖的时间句子追踪网络(TSTNet),其包含(A)一个跨模态目标生成器,用于生成多模态模板与搜索空间并筛选对象与活动,以及(B)一个时间句子追踪器,用于追踪多模态目标以建模目标行为并预测查询相关片段。我们在具有挑战性的基准Charades-STA和TACoS上进行了大量实验并与SOTA方法比较。我们的TSTNet以可观的实时速度取得了领先性能。

关键词

引用

@article{arxiv.2302.10813,
  title  = {Tracking Objects and Activities with Attention for Temporal Sentence Grounding},
  author = {Zeyu Xiong and Daizong Liu and Pan Zhou and Jiahao Zhu},
  journal= {arXiv preprint arXiv:2302.10813},
  year   = {2023}
}

备注

accepted by ICASSP2023