中文

基于时间偏移交叉注意力的视觉Transformer用于高效动作识别

计算机视觉与模式识别 2022-11-15 v2

摘要

自时间偏移模块(TSM)提出以来,特征偏移已被证明对基于CNN模型的动作识别有用。它基于逐帧特征提取与后期融合,并将层特征沿时间方向偏移以实现时间交互。TokenShift是近期基于视觉Transformer(ViT)的模型,也使用了时间特征偏移机制,但其未充分利用ViT中多头自注意力(MSA)的结构。本文提出多头自/交叉注意力(MSCA),充分利用注意力结构。TokenShift基于逐帧ViT,其特征与相邻帧(t+1和t-1时刻)在时间上偏移。相比之下,所提MSCA替换了逐帧ViT中的MSA,且部分MSA头关注相邻帧而非当前帧。计算成本与逐帧ViT和TokenShift相同,因其仅改变注意力的目标。关于从相邻帧取键、查询和值中的哪些项存在选择,我们据此在Kinetics400上对这些变体进行了实验比较。我们还研究了其他变体,其中所提MSCA沿ViT的补丁维度而非头维度使用。实验结果表明,变体MSCA-KV表现最佳,比TokenShift高0.1%,比ViT高1.2%。

关键词

引用

@article{arxiv.2204.00452,
  title  = {Vision Transformer with Cross-attention by Temporal Shift for Efficient Action Recognition},
  author = {Ryota Hashiguchi and Toru Tamaki},
  journal= {arXiv preprint arXiv:2204.00452},
  year   = {2022}
}

备注

Temporal Cross-attention for Action Recognition, presented at ACCV2022 Workshop on Vision Transformers: Theory and applications (VTTA-ACCV2022), Galaxy Macau, Macau/Online, 2022/12/4-5