中文

STAR-GNN:用于基于内容检索的时空视频表示

计算机视觉与模式识别 2022-08-16 v1

摘要

我们提出了一种称为 STAR-GNN 的视频特征表示学习框架,该框架在多尺度格子特征图上应用可插拔的图神经网络组件。STAR-GNN 的本质是利用帧中不同尺度区域间的时间动态、空间内容以及视觉关联。它以格子特征图对视频建模,其中节点表示不同粒度的区域,带权边表示空间与时间链接。上下文节点由图神经网络同时聚合,其参数通过检索三元组损失训练。在实验中,我们表明 STAR-GNN 在视频帧序列上有效地实现了动态注意力机制,从而突出视频中动态且语义丰富的内容,并对噪声与冗余具有鲁棒性。实证结果表明,STAR-GNN 在基于内容的视频检索(Content-Based Video Retrieval)中达到了最先进的性能。

关键词

引用

@article{arxiv.2208.06966,
  title  = {STAR-GNN: Spatial-Temporal Video Representation for Content-based Retrieval},
  author = {Guoping Zhao and Bingqing Zhang and Mingyu Zhang and Yaxian Li and Jiajun Liu and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2208.06966},
  year   = {2022}
}

备注

6 pages, 2 figures, ICME 2022 accepted paper