中文

SFMViT:混沌世界中的SlowFast与ViT结合

计算机视觉与模式识别 2024-08-14 v2 人工智能

摘要

混沌场景中的时空动作定位是高级视频理解的一项具有挑战性的任务。通过高质量的视频特征提取和增强检测器预测锚点的精度,可以有效地提高模型性能。为此,我们提出了一种高性能的双流时空特征提取网络SFMViT,并配以锚点剪枝策略。我们SFMViT的主干由ViT和SlowFast组成,并融入了时空动作定位的先验知识,充分利用了ViT出色的全局特征提取能力和SlowFast的时空序列建模能力。其次,我们引入了置信度最大堆来对每帧图片中检测到的锚点进行剪枝,以筛选出有效的锚点。这些设计使得我们的SFMViT在Chaotic World数据集上达到了26.62%的mAP,远超现有模型。代码可在 https://github.com/jfightyr/SlowFast-Meet-ViT 获取。

关键词

引用

@article{arxiv.2404.16609,
  title  = {SFMViT: SlowFast Meet ViT in Chaotic World},
  author = {Jiaying Lin and Jiajun Wen and Mengyuan Liu and Jinfu Liu and Baiqiao Yin and Yue Li},
  journal= {arXiv preprint arXiv:2404.16609},
  year   = {2024}
}