论空间关系在小样本动作识别中的重要性
计算机视觉与模式识别
2023-08-15 v1
摘要
深度学习在视频识别中取得了巨大成功,但在仅面对少量样本时仍难以识别新颖动作。为应对此挑战,已提出小样本动作识别方法,将知识从源数据集迁移到仅含一个或少数标注视频的新目标数据集。然而,现有方法主要关注建模查询与支持视频间的时间关系,而忽略了空间关系。在本文中,我们发现视频中物体间的空间错位同样会发生,且明显比时间不一致更为常见。因此我们受此启发探究空间关系的重要性,并提出一种利用空间与时间信息、更精确的小样本动作识别方法。特别地,我们提出了一种新颖的空间对齐交叉Transformer(SA-CT),其学习重新调整空间关系并融合时间信息。实验表明,即使不使用任何时间信息,SA-CT在3/4基准上的性能也可与基于时间的方法相媲美。为进一步融入时间信息,我们提出一个简单而有效的时序混合(Temporal Mixer)模块。该Temporal Mixer增强了视频表示并提升了完整SA-CT模型的性能,取得了极具竞争力的结果。在本工作中,我们还探索了用于小样本动作识别的大规模预训练模型,为该研究方向提供了有益见解。
引用
@article{arxiv.2308.07119,
title = {On the Importance of Spatial Relations for Few-shot Action Recognition},
author = {Yilun Zhang and Yuqian Fu and Xingjun Ma and Lizhe Qi and Jingjing Chen and Zuxuan Wu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2308.07119},
year = {2023}
}