中文

Gated-ViGAT:利用新帧选择策略与门控机制的高效自底向上视频事件识别与解释

计算机视觉与模式识别 2023-01-19 v1

摘要

本文提出 Gated-ViGAT,一种利用自底向上(物体)信息、新帧采样策略与门控机制的高效视频事件识别方法。具体而言,帧采样策略使用由图注意力网络(GATs)的邻接矩阵导出的加权入度(WiDs)以及一种不相似度度量,来选取最具显著性且同时具多样性的代表视频中事件的帧。此外,所提门控机制顺序提取所选帧,并在获得足够置信的决策时执行早退。以此方式,仅少数帧由负责自底向上信息提取的计算昂贵网络分支处理。在两个大型公开视频数据集(MiniKinetics、ActivityNet)上的实验评估表明,与我们先前方法(ViGAT)相比,Gated-ViGAT 大幅降低了计算复杂度,同时保持了优异的事件识别与可解释性性能。Gated-ViGAT 源代码公开于 https://github.com/bmezaris/Gated-ViGAT

关键词

引用

@article{arxiv.2301.07565,
  title  = {Gated-ViGAT: Efficient Bottom-Up Event Recognition and Explanation Using a New Frame Selection Policy and Gating Mechanism},
  author = {Nikolaos Gkalelis and Dimitrios Daskalakis and Vasileios Mezaris},
  journal= {arXiv preprint arXiv:2301.07565},
  year   = {2023}
}

备注

Accepted for publication in the proceedings of IEEE Int. Symposium on Multimedia (ISM), Naples, Italy, Dec. 2022