用于少样本动作识别的时序关系交叉Transformer
计算机视觉与模式识别
2021-03-30 v3
摘要
我们提出一种新颖的少样本动作识别方法,在查询视频与支持集视频间寻找时序对应的帧元组。与以往少样本工作不同,我们使用CrossTransformer注意力机制构建类原型,以观测所有支持视频的相关子序列,而非使用类平均或单一最佳匹配。视频表示由可变帧数的有序元组构成,从而可比较不同速度与 temporal 偏移下的动作子序列。我们提出的时序关系交叉Transformer(TRX)在Kinetics、Something-Something V2(SSv2)、HMDB51和UCF101的少样本划分上取得了最先进(SOTA)结果。重要的是,由于建模时序关系的能力,我们的方法在SSv2上以较大优势(12%)超越先前工作。详细的消融实验展示了匹配多个支持集视频和学习高阶关系CrossTransformer的重要性。
引用
@article{arxiv.2101.06184,
title = {Temporal-Relational CrossTransformers for Few-Shot Action Recognition},
author = {Toby Perrett and Alessandro Masullo and Tilo Burghardt and Majid Mirmehdi and Dima Damen},
journal= {arXiv preprint arXiv:2101.06184},
year = {2021}
}
备注
Accepted in CVPR 2021