中文

ViGAT:基于因子化图注意力网络的视频自底向上事件识别与解释

计算机视觉与模式识别 2022-11-01 v2 人工智能 机器学习 多媒体

摘要

本文提出一种纯注意力的自底向上方法,称为 ViGAT,其利用目标检测器与 Vision Transformer(ViT)骨干网络提取目标与帧特征,并利用头部网络处理这些特征以完成视频中事件识别与解释任务。ViGAT 头部由沿空间与时间维度因子化的图注意力网络(GAT)块组成,以有效捕获目标或帧之间的局部与长程依赖。此外,利用从各 GAT 块的邻接矩阵导出的加权入度(WiD),我们表明所提架构可识别解释网络决策的最显著目标与帧。我们进行了综合评估研究,证明所提方法在三个大型公开视频数据集(FCVID、Mini-Kinetics、ActivityNet)上取得了最先进(state-of-the-art)结果。

关键词

引用

@article{arxiv.2207.09927,
  title  = {ViGAT: Bottom-up event recognition and explanation in video using factorized graph attention network},
  author = {Nikolaos Gkalelis and Dimitrios Daskalakis and Vasileios Mezaris},
  journal= {arXiv preprint arXiv:2207.09927},
  year   = {2022}
}