MASTAF:一种用于小样本视频分类的模型无关时空注意力融合网络
计算机视觉与模式识别
2022-10-18 v3 机器学习
摘要
我们提出了MASTAF,一种用于小样本视频分类的模型无关时空注意力融合网络。MASTAF从通用的视频空间和时间表示中获取输入,例如使用2D CNN、3D CNN和Video Transformer。然后,为了充分利用这些表示,我们使用自注意力和交叉注意力模型来突出关键的时空区域,以增加类间差异并减少类内差异。最后,MASTAF应用一个轻量级融合网络和一个最近邻分类器对每个查询视频进行分类。我们证明,MASTAF在三个小样本视频分类基准数据集(UCF101、HMDB51和Something-Something-V2)上提高了最先进的性能,例如,在五类单样本视频分类中,分别达到了91.6%、69.5%和60.7%的准确率。
引用
@article{arxiv.2112.04585,
title = {MASTAF: A Model-Agnostic Spatio-Temporal Attention Fusion Network for Few-shot Video Classification},
author = {Rex Liu and Huanle Zhang and Hamed Pirsiavash and Xin Liu},
journal= {arXiv preprint arXiv:2112.04585},
year = {2022}
}
备注
WACV 2023